Noticias de IA de generación de imágenes y vídeo — 2026-09-05
GPT-6 «Astra» dominó esta semana la conversación sobre modelos cerrados en X y Bluesky, mientras que los modelos abiertos de vídeo e imagen (LTX-2.5, MiniMax H3 y Qwen-Image-3.0) mantuvieron el ritmo casi por completo dentro del ecosistema ComfyUI. La mayor noticia, sin embargo, fue el giro de Midjourney: dejó la generación de imágenes para dedicarse al hardware de ultrasonido médico.
Resumen de noticias sobre IA de generación de imágenes y vídeo — cerrado vs. abierto — 2026-09-05
¡Hola! El mundo de la IA de generación de imágenes y vídeo estuvo completamente caótico esta semana www🔥 Del lado cerrado, GPT-6 «Astra» de OpenAI arrasó en X (antes Twitter) con un anuncio que superó los 100 millones de visualizaciones 😳. Por otro lado, el ecosistema de código abierto tampoco se quedó atrás: aparecieron uno tras otro modelos de gran nivel como LTX-2.5, MiniMax H3 y Qwen-Image-3.0 con pesos abiertos, y ComfyUI se está consolidando como la verdadera nave nodriza 🛠️. Otra noticia discretamente enorme fue que Midjourney dejó la generación de imágenes para pivotar hacia una empresa de escáneres médicos por ultrasonido 😱. Fue realmente impactante. También descubrimos que, para la comunidad de Reddit, el debate sobre el «tratamiento legal de las obras generadas por IA» resultó más atractivo que la evolución técnica.
En todas las plataformas
- La fiesta de GPT-6 Astra: se volvió tendencia de inmediato tanto en X como en Bluesky (con el benchmark de imágenes de pelícanos de Simon Willison). X: https://x.com/OpenAI/status/2095595741528125780 / Bluesky: https://bsky.app/profile/simonwillison.net/post/3mupxubgrls2c . Lo interesante es que, aunque no se promociona como una IA de generación de imágenes o vídeo, todo el mundo está probando Astra para modelado 3D y animación 😂
- ComfyUI es de facto la base del código abierto: en YouTube y Lemmy, Wan, FLUX, Qwen-Image, LTX-2.5, MiniMax H3 y hasta Trellis.2 se mencionan siempre junto a ComfyUI. YouTube: https://www.youtube.com/watch?v=3BFDcO2Ysu4 / Lemmy: https://blog.comfy.org/p/trellis2-and-pixal3d-are-now-native
- El problema de MiniMax H3: «es abierto, pero el uso comercial es de pago»: también fue tema en Lemmy (un modelo de vídeo que funciona incluso en una RTX 3060, pero exige una licencia de pago a través de Comfy) https://blog.comfy.org/p/comfy-is-now-the-only-official-reseller . La frontera entre abierto y cerrado se está volviendo realmente difusa 🤔
- Las polémicas y los giros generan más interés que la tecnología: fue un patrón visible tanto en Reddit (más de 800 comentarios sobre una resolución judicial referente a CSAM generado por IA) https://www.reddit.com/r/news/comments/1w5k6pr/ como en Lemmy (el giro de Midjourney hacia dispositivos médicos, puntuación de 58 a 73) https://lemmy.zip/post/66397234 .
Plataforma por plataforma
Reddit: el resumen mensual de r/StableDiffusion (una avalancha de modelos abiertos como Qwen3.8, DeepSeek-V4-Pro, Ling-3.0 y Gemma-4-31B, a un ritmo que ni siquiera los comentarios pueden seguir) fue un hilo excepcional https://www.reddit.com/r/StableDiffusion/comments/1w3rwoe/ . También destacó Atlas de World Labs, una tecnología capaz de generar al instante mundos 3D a partir de vídeo o fotos y con potencial para la robótica https://www.reddit.com/r/accelerate/comments/1w5ye9s/ . Pero lo que más atención recibió no fue una noticia técnica: fue el hilo sobre la sentencia que consideró constitucional la pornografía infantil generada por IA. En Reddit, los temas jurídicos y éticos parecen generar más debate.
X: la búsqueda acabó mostrando solo cuatro publicaciones sobre Astra, por lo que GPT-6 Astra se llevó todo el protagonismo 🎤. Además del tuit de anuncio con 108.000.000 de visualizaciones, la publicación más técnica fue la demostración del desarrollador @Dimillian de un flujo 3D «de Blender a UE5» https://x.com/Dimillian/status/2095596700815516004 . En el alcance de esta búsqueda no apareció ni una sola publicación sobre proyectos abiertos como Stable Diffusion, Flux o Wan: una laguna muy importante.
YouTube: del lado cerrado hubo muchos análisis comparativos de Nano Banana 2, Kling 3.0 vs. Veo 3.1 vs. Sora 2, Seedance 2.5 y Seedream 5.0 Pro https://www.youtube.com/watch?v=AAD7wJ3DWiA . Del lado abierto, LTX-2.5 (un modelo ultrarrápido que genera diez segundos a 720p en 6,8 segundos) https://www.youtube.com/watch?v=RjlbDhs1MPk y HunyuanImage 3.0 (MoE de 80B de parámetros) https://www.youtube.com/watch?v=U-8RjjU7x14 muestran que los pesos abiertos ya se comparan con los modelos cerrados inmediatamente después de anunciarse. También apareció la información de que OpenAI cerrará la API de Sora para concentrar recursos en su siguiente modelo, «Spud» (el vídeo de YouTube en sí no se pudo verificar; procede de noticias).
Bluesky: el habitual «benchmark de imágenes de pelícanos» de Simon Willison se ha convertido en un observatorio constante de calidad para modelos cerrados https://bsky.app/profile/simonwillison.net/post/3mupxubgrls2c . La cuenta oficial de Replicate funciona como centro de avisos de lanzamientos de modelos de vídeo como Kling 3.0, Seedance 2.0, Runway Gen-4.5 y Vidu Q3 https://bsky.app/profile/replicate.com/post/3mf5fbf6u4l2c . Casi no hay comunicación primaria sobre código abierto; el propio desarrollador de herramientas LoRA ostris llegó a decir que «la comunidad de IA/ML sigue casi por completo en X (Twitter)» 😅. En japonés, se compartió sobre todo el artículo de GIGAZINE sobre Qwen-Image-3.0 https://gigazine.net/news/20260722-qwen-image-3/ .
Lemmy: !«メールアドレス» es la comunidad con mayor densidad informativa sobre modelos abiertos. Casi la mitad de las publicaciones giraban en torno a MiniMax H3 (Comfy como revendedor comercial https://blog.comfy.org/p/comfy-is-now-the-only-official-reseller , herramientas que funcionan con 16 GB de VRAM, etc.). También es muy relevante LLaDA-Image, con una receta de entrenamiento completamente pública https://arxiv.org/abs/2609.03796 . Del lado cerrado, más que los nuevos modelos, lo que obtuvo una puntuación desproporcionadamente alta (58–73) fue la noticia de que Midjourney pivotaba de la generación de imágenes a los escáneres médicos por ultrasonido.
Pinterest: visualmente dominaron claramente los actores cerrados (Google Veo 2/3, Microsoft VASA-1, Grok 4.6 y Gemini superando los mil millones de usuarios) como material para imágenes recopilatorias. Entre los nombres propios abiertos, apenas apareció la herramienta local de AMD «Amuse 3.0». Además, abundan los casos de uso de «hacer o animar caras» —sincronización labial, reproducción de expresiones y generación de retratos—, probablemente porque encajan muy bien con el público de Pinterest, interesado en belleza e ideas para publicaciones en redes sociales.
Qué vigilar
- Novedades de GPT-6 Astra orientadas a imagen/vídeo — X, https://x.com/flowith/status/2095750768204877858 (enfrentamiento de animación entre GPT-6 Astra y GPT-5.6, anunciado próximamente)
- Fin de la API de Sora → siguiente modelo «Spud» — según la investigación en YouTube, la API cerrará el 24 de septiembre de 2026. Nadie ha verificado aún las imágenes ni las funciones reales.
- La evolución de las licencias comerciales de MiniMax H3 — Lemmy, https://blog.comfy.org/p/comfy-is-now-the-only-official-reseller (queda por ver si se consolida este modelo híbrido: pesos abiertos, pero uso comercial de pago)
- El giro de Midjourney hacia equipos médicos — Lemmy, https://lemmy.zip/post/66397234 (¿abandonará realmente uno de los grandes actores cerrados la generación de imágenes por IA?)
- La receta de entrenamiento totalmente abierta de LLaDA-Image — Lemmy/arXiv, https://arxiv.org/abs/2609.03796 (hasta qué punto otros replicarán un modelo abierto de alto rendimiento en Qwen-Image-Bench)
- Atlas de World Labs — Reddit, https://www.reddit.com/r/accelerate/comments/1w5ye9s/ (cómo se reutilizará la generación de mundos 3D a partir de vídeo para datos de entrenamiento robótico)
Recomendaciones
- Conviene repetir la recopilación de X usando etiquetas concretas como «Stable Diffusion», «ComfyUI», «Flux», «Wan», «Kling» y «Sora», en lugar de depender de tendencias generales.
- Como la API
searchPostsde Bluesky devolvió 403, la próxima vez sería más eficiente ampliar de antemano una lista de cuentas conocidas mediante búsquedas en Google. - Modelos como MiniMax H3, con pesos abiertos pero uso comercial de pago, deberían señalarse explícitamente en los informes en vez de clasificarse simplemente como «abiertos».
- Noticias de retirada o cambio estratégico de grandes empresas, como el giro de Midjourney o el cierre de Sora por OpenAI, merecen una sección de seguimiento permanente: atraen más atención que las noticias técnicas.
- Como Pinterest tiene poca información primaria, parece más útil como termómetro de recepción entre consumidores que como fuente para detectar tendencias técnicas.
- La tendencia observada en Reddit y Lemmy —las resoluciones judiciales y controversias éticas generan más ruido que las noticias técnicas— merece incluirse como una señal independiente en futuros resúmenes.
Calidad de los datos
- X: las publicaciones recopiladas partían de tendencias geolocalizadas en Croacia, por lo que, salvo cuatro publicaciones de GPT-6 Astra, aparecieron ruidos irrelevantes (criptomonedas, contenido sobre Elon y deportes). No hubo menciones al código abierto y no se alcanzó el objetivo de «analizar 20 publicaciones».
- Bluesky: la API oficial de búsqueda devolvió 403, por lo que se pasó a revisar feeds individuales de cuentas conocidas. Solo se encontraron unas 12 publicaciones directamente relevantes y casi ninguna fuente primaria sobre código abierto.
- Reddit: con una sola consulta se obtuvieron 12 hilos de 9 subreddits, por debajo del objetivo de 20. Aun así, se registraron hasta seis comentarios principales por hilo.
- YouTube: las páginas de resultados y vídeos se renderizan con JavaScript, por lo que no se pudieron verificar directamente las visualizaciones, suscriptores ni fechas exactas; las fechas se estimaron a partir de formatos relativos en los fragmentos.
- Lemmy: al ser federado, una búsqueda en una sola instancia omite publicaciones de otras instancias. Las búsquedas directas de servicios cerrados de vídeo como Sora, Kling o Veo casi no dieron resultados.
- Pinterest: de 50 elementos, solo se abrieron y verificaron realmente 24 imágenes; del resto solo se revisó el título. Los datos recopilados no incluían indicadores de interacción como me gusta o guardados.
Resumen por plataforma
Reddit — Noticias de IA de generación de imágenes y vídeo
Dónde
Los 12 hilos recopilados proceden de nueve subreddits. La única consulta fue «Image and Video Generation AI News».
| Subreddit | Suscriptores | Hilos recopilados |
|---|---|---|
| r/generativeAI | 150,575 | 4 |
| r/GrokAiDiscussion | 4,883 | 1 |
| r/freetoolsAI | 7,616 | 1 |
| r/StableDiffusion | 1,000,814 | 1 |
| r/accelerate | 77,800 | 1 |
| r/news | 31,531,475 | 1 |
| r/antiai | 313,317 | 1 |
| r/allthequestions | 127,064 | 1 |
| r/teenagers | 3,673,210 | 1 |
r/generativeAI fue el subreddit con más publicaciones (4), un centro de publicaciones informales sobre búsqueda y comparación de herramientas. El resto aportó un hilo cada uno. Resulta llamativo que el tema también llegara a subreddits no especializados en generación de imágenes o vídeo, como r/news y r/teenagers.
Qué dice la gente
- #4 r/StableDiffusion «Noticias locales de IA que quizá te perdiste - agosto de 2026» (201 puntos · 22 comentarios · 2026-08-31, https://www.reddit.com/r/StableDiffusion/comments/1w3rwoe/) — Un resumen mensual que afirma que solo en agosto se lanzaron numerosos modelos abiertos, entre ellos Qwen3.8, DeepSeek-V4-Pro-0813, la familia Ling-3.0 y Gemma-4-31B. Los comentarios añadían lanzamientos sin parar: u/Narutobirama(20) comentó «Probablemente te perdiste Qwen3.8 Flash Next», y u/MoJaKF(14) «Anima-3.8B ya va por la versión 1.1, publicada hace tres horas», mostrando un ritmo que ni siquiera el propio resumen puede seguir.
- #5 r/accelerate «…Crearon una IA que toma unos pocos vídeos o fotos casuales del mundo real y los convierte al instante en un parque de juegos 3D completo» (763 puntos · 76 comentarios · 2026-09-03, https://www.reddit.com/r/accelerate/comments/1w5ye9s/) — Sobre Atlas de World Labs, que genera mundos 3D interactivos a partir de vídeo o fotos. Las reacciones fueron entusiastas; u/stainless_steelcat(48) escribió: «El tiempo bala de Matrix llega a la vida real... ahora sé que no era lo bastante ambicioso». Se habló también de aplicar la tecnología de generación de vídeo a datos de entrenamiento para robótica.
- #6 r/generativeAI «Mismo prompt. Mismos 30 segundos. Dos modelos de vídeo con IA diferentes.» (98 puntos · 30 comentarios · 2026-09-03, https://www.reddit.com/r/generativeAI/comments/1w60fip/) — Comparación entre Seedance 2.5 y Wan 3.0 con el mismo prompt. u/SpecialistDragonfly9(5) consideró que «seedance es, CON MUCHA diferencia, superior», mientras u/Positive-Key6640(4) cuestionó el método: «Las comparaciones con el mismo prompt son divertidas, pero sobre todo miden qué modelo encaja con tu estilo de prompt, no cuál es mejor».
- #2 r/GrokAiDiscussion «¿Han flexibilizado la moderación de generación de imagen a vídeo?» (14 puntos · 28 comentarios · 2026-08-29, https://www.reddit.com/r/GrokAiDiscussion/comments/1w1w0e8/) — Las experiencias de los usuarios sobre la moderación de Grok Imagine están divididas. Mientras u/Miserable_Appeal515(2) dice que «ha mejorado», u/joderrelldalejr(2) afirma lo contrario: «Para nada; empeora y luego empiezan a limitar cuántas imágenes puedes hacer por semana».
- #1 r/generativeAI «Lista de sitios web diarios de generación de vídeo con IA» (38 puntos · 27 comentarios · 2026-08-31, https://www.reddit.com/r/generativeAI/comments/1w3frr2/) — Intercambio de información para usuarios que quieren exprimir las cuotas gratuitas. Kling AI ofrece «66 créditos gratis cada 24 horas», u/Murky-Race-3443(1) señaló que «capcut también da créditos diarios gratuitos», y u/Julia_Leeds94(1) presentó YalleryLabs: vídeos de cinco segundos a 720p desde 0,18 USD con un presupuesto de 3 USD.
- #3 r/freetoolsAI «Generador de imágenes con IA gratuito» (31 puntos · 31 comentarios · 2026-09-04, https://www.reddit.com/r/freetoolsAI/comments/1w6w0rj/) — Una publicación promocional de un sitio que prometía generación gratuita sin registro atrajo comentarios; u/Odd-Lingonberry1516(2) enumeró alternativas como Deepany, Aifun y Perchance. u/thecragmire(1) también preguntó por el modelo de negocio: «¿Cómo mantienes esto? Tiene que costarte algo, ¿no?».
- #11 r/generativeAI «¿BUENO para imagen a vídeo?» (1 punto · 13 comentarios · 2026-08-29, https://www.reddit.com/r/generativeAI/comments/1w20rq1/) — Kling AI fue considerado «prácticamente el rey para movimiento humano realista», y Runway «el estándar de oro para control creativo». Como opción local, u/Ok-Addition1264(2) recomendó ComfyUI + WAN22/LTX2.3.
- #7 r/generativeAI «¿Algún buen sitio de vídeo con IA? ¿Aunque sea de pago?» (0 puntos · 15 comentarios · 2026-08-31, https://www.reddit.com/r/generativeAI/comments/1w3kptg/) — u/Previous-Course-5160(1) consideró que Gen-3 de Runway «maneja el movimiento bastante bien comparado con muchos resultados torpes», pero fue duro con Pika: «es divertido para bucles rápidos... pero el resultado se vuelve repetitivo al cabo de un tiempo».
- #8/#10 r/news «Un juez federal dictamina que el material de abuso sexual infantil generado por IA está protegido por la Primera Enmienda.» (1.379 puntos · 545 comentarios · 2026-09-02, https://www.reddit.com/r/news/comments/1w5k6pr/) y r/allthequestions «¿Por qué un juez federal declaró legal la creación de pornografía infantil generada por IA?» (31 puntos · 277 comentarios · 2026-08-31, https://www.reddit.com/r/allthequestions/comments/1w3hf3o/) — El debate sobre la condición legal de las obras generadas por IA obtuvo un nivel de interacción excepcional. u/Ntroepy(414) señaló que el titular era engañoso y que la decisión estaba condicionada por una sentencia del Tribunal Supremo de 2002. En r/allthequestions, u/TheGracefulCrane(31) resumió la interpretación jurídica: los jueces no crean leyes y la legislación no se ha actualizado para prohibirlo.
- #9 r/antiai «Las imágenes generadas por IA son cada vez más difíciles de detectar» (113 puntos · 30 comentarios · 2026-08-30, https://www.reddit.com/r/antiai/comments/1w2mr8g/) — Pese al título, los comentarios se centraron en bromas sobre extremidades defectuosas, como u/GurInside278(31): «¿Por qué sus pies son sus manos?». El contraste resultó irónico.
- #12 r/teenagers «Para todos los usuarios de generadores de imágenes/vídeo con IA» (7 puntos · 41 comentarios · 2026-08-31, https://www.reddit.com/r/teenagers/comments/1w2y305/) — Una publicación que respondía a la idea de que «el arte de IA no requiere trabajo artístico». Comentarios como el de u/LiterallyGarbage_0(5), «la gente que usa IA para hacer “arte” me enfada muchísimo... coge un lápiz», reflejaron un fuerte sentimiento anti-IA entre adolescentes.
Señales
- Al alza: la frecuencia de lanzamiento de modelos locales abiertos —LLM, imagen y vídeo— avanza tan deprisa que ni siquiera los comentarios del hilo #4 pueden seguirla. También está creciendo un nuevo eje de interés: usos de la generación de vídeo para datos de entrenamiento robótico, como Atlas de World Labs (#5).
- Opiniones enfrentadas: las experiencias con la moderación de Grok Imagine (#2) se dividen por completo entre «ha mejorado» y «ha empeorado». En Seedance frente a Wan (#6), conviven la opinión de que Seedance gana por goleada y la crítica de que las comparaciones con un solo prompt tienen poco valor. No hay una conclusión única.
- Cuestionado o minimizado: el formato habitual de comparar modelos con el mismo prompt (#6) fue criticado por u/Positive-Key6640 como método.
- Lo sorprendente: el hilo #9, titulado «Las imágenes generadas por IA son cada vez más difíciles de detectar», acabó haciendo bromas sobre fallos en manos y pies, dejando una clara distancia entre su tesis y la reacción real. Además, las decisiones judiciales (#8 y #10, más de 800 comentarios en conjunto) superaron con creces la interacción de las noticias de producto: en Reddit, el tratamiento legal y ético de las obras de IA es un foco de conflicto mayor que el progreso técnico.
Límites
- Solo se usó la consulta «Image and Video Generation AI News», que devolvió 12 hilos de 9 subreddits. No se alcanzó el objetivo de unas 20 publicaciones por red que exige brief.md.
- En esta fase solo se leyeron
output/reddit.threads.md/.threads.json, recopilados previamente por un trabajador; siguiendo las instrucciones del playbook, no se realizaron nuevas búsquedas ni se accedió directamente a hilos o comentarios. Es muy probable que haya omisiones fuera del alcance de esa única consulta. - Solo se registraron hasta seis comentarios principales por hilo, por lo que no se reflejan reacciones inferiores ni opiniones minoritarias.
X
X — Noticias de IA de generación de imágenes y vídeo
Cuentas
De las 34 cuentas de esta recopilación, solo cuatro publicaron algo relacionado con IA de generación de imágenes o vídeo, y todas sobre el mismo lanzamiento dentro de las mismas 24 horas (2026-09-03):
- @OpenAI (OpenAI) — una publicación, pero fue toda la historia: 309.095 me gusta, 55.587 republicaciones y unas 108.000.000 de visualizaciones. La cuenta hizo lo mínimo, un tuit de anuncio con una imagen, y dejó que el volumen hiciera el resto.
- @MatthewBerman (Matthew Berman) — cuenta de influencer de IA, una publicación (4.054 me gusta y unas 1.500.000 visualizaciones) planteada como hilo de primeras pruebas con «acceso anticipado», posicionándolo como evaluador y no como fuente.
- @Dimillian (Thomas Ricouard) — una publicación (7.199 me gusta y unas 2.300.000 visualizaciones) en la que un desarrollador mostró un flujo concreto (Blender → Unreal Engine 5), en vez de entusiasmo general; fue la afirmación técnica más concreta del conjunto.
- @flowith (Flowith) — la cuenta más pequeña (947 me gusta y unas 115.000 visualizaciones), una cuenta de producto que aprovechó el lanzamiento con una comparación directa frente al modelo anterior.
Todas las demás cuentas de la recopilación (34 en total, 40 publicaciones) —cuentas de cripto y memes (@songoncardano, @nmkr_io, @legsdotfun, @robincatonhood), de fans de Elon/Tesla (@LunarOptimus, @Optimus_RH, @HeavyMetalShip), un influencer de ciberseguridad (@corewarrior, @hackerzspace), cuentas de noticias y memes de Polonia, África y Bosnia, cuentas de fans de Ariana Grande (@vodolove publicó 3 de sus 4 elementos), y cuentas de sorteos de marcas de cerveza (@naturallight, @ChinookCi)— no tenían nada que ver con IA de generación de imágenes o vídeo. Se mencionan solo porque eso fue lo que devolvió la recopilación; véanse los límites.
Publicaciones
1. Lanzamiento de GPT-6 «Astra» — @OpenAI
- 309.095 me gusta · 55.587 republicaciones · 7.713 respuestas · unas 108.000.000 visualizaciones · 2026-09-03
- https://x.com/OpenAI/status/2095595741528125780
«Esto es GPT-6 Astra. Todo lo que puedas hacer en un ordenador, Astra puede hacerlo por ti. Rápido.»
La publicación individual más grande de toda la recopilación, por un orden de magnitud. Se presentó como un agente de uso general de ordenador, no como un modelo específico de imagen o vídeo; sin embargo, las demostraciones posteriores de otras cuentas fueron todas visuales o 3D, lo que sugiere que las fortalezas mostradas de Astra se inclinan hacia ese terreno.
2. Astra frente al modelo anterior, planteado en torno a la animación — @flowith
- 947 me gusta · 69 republicaciones · 19 respuestas · unas 115.000 visualizaciones · 2026-09-04
- https://x.com/flowith/status/2095750768204877858
«Próximamente en flowith.io: GPT-6 Astra VS GPT-5.6 en animación»
Una cuenta de producto de terceros que prepara explícitamente una comparación de animación entre Astra y la generación anterior: una señal concreta de que Astra se está probando y promocionando específicamente en capacidad de generación de animación, no solo en uso general del ordenador.
3. Hilo de primeras pruebas con acceso anticipado — @MatthewBerman
- 4.054 me gusta · 494 republicaciones · 210 respuestas · unas 1.500.000 visualizaciones · 2026-09-03
- https://x.com/MatthewBerman/status/2095595892464333065
«¡¡¡Astra (GPT-6) ya está aquí!!! He tenido acceso anticipado y lo he probado a fondo con cosas como juegos, código, escritura, control del navegador, presentaciones y trabajo de conocimiento general. Es el mejor modelo que he usado nunca. Punto.»
Destaca por lo que no menciona: no nombra explícitamente la generación de imágenes ni de vídeo en su lista de capacidades, aunque el hilo promete «demostraciones increíbles abajo».
4. Recorrido de Blender a Unreal Engine 5 — @Dimillian
- 7.199 me gusta · 1.145 republicaciones · 259 respuestas · unas 2.300.000 visualizaciones · 2026-09-03
- https://x.com/Dimillian/status/2095596700815516004
«Astra es muy bueno en modelado 3D, y estoy deseando que todos podáis probarlo. Por ahora, aquí va un pequeño recorrido de cómo construí la casa de demostración para la publicación de lanzamiento de nuestro blog: desde una escena de Blender hasta una experiencia recorrible en Unreal Engine 5.»
La afirmación más concreta y específica sobre herramientas de la recopilación: Astra se usó dentro de un flujo real de contenido 3D (Blender → UE5), más cercano a un flujo de generación visual o de vídeo que cualquier otra cosa mostrada por X en esta ejecución.
Señales
- Al alza: GPT-6 «Astra» fue la única historia relacionada con imagen/vídeo que apareció en esta recopilación y dominó por interacción (unas 108M de visualizaciones solo en el anuncio, frente a cientos de miles bajos para el resto). El grupo de reacciones —comparación de producto, primeras pruebas de un influencer y demostración de un desarrollador de un flujo 3D— dentro de 24 horas parece un lanzamiento coordinado, no un descubrimiento orgánico.
- Descartado o ausente: ningún modelo abierto de generación de imágenes o vídeo (Stable Diffusion, Flux, Wan, HunyuanVideo, Kling, ComfyUI, etc.) aparece en la recopilación. Si hay actividad de IA abierta de imagen o vídeo en X, esta búsqueda no llegó a ella.
- Sorprendente: muy poco del discurso sobre el lanzamiento de «IA» nombra la generación de imágenes o vídeo como función. La lista de Matthew Berman ni siquiera lo menciona, y Astra se comercializa como agente general («todo lo que puedas hacer en un ordenador»). El ángulo de imagen/vídeo se infiere de lo que los primeros evaluadores eligieron demostrar (modelado 3D y comparación de animación), no del planteamiento de OpenAI.
Límites
- Las búsquedas recopiladas no se dirigían a este tema. Los diez términos buscados —«Astra», «$SONG», «Robinhood», «Elon», «#CyberSecurity», «Poland», «Africa», «Bosnia», «ariana», «#Sweepstakes»— son la lista de tendencias de X de esta sesión, no términos seleccionados para IA de generación de imágenes o vídeo. Solo las búsquedas de «Astra» (publicaciones #1–4) devolvieron contenido pertinente; las otras 36 publicaciones eran ruido no relacionado.
- Los criterios de completitud no se cumplen con estos datos. El encargo pide analizar aproximadamente 20 publicaciones por plataforma sobre el tema; esta recopilación ofrece solo 4 publicaciones útiles, todas sobre un lanzamiento cerrado, GPT-6 Astra, y ninguna sobre generación abierta. Haría falta buscar «Stable Diffusion», «ComfyUI», «Flux», «Kling AI», «Runway», «Sora», «Midjourney», «Wan 2.x» o «HunyuanVideo» para cubrir realmente el encargo en X.
- Advertencia de geolocalización: la lista Explore de X de esta sesión está geolocalizada en Croacia —la mayoría de entradas se etiquetan explícitamente como «Tendencia en Croacia»—, de ahí el predominio de tokens cripto, fútbol bosnio y noticias o memes balcánicos. Es la tendencia de una ubicación de servidor, no una visión global.
- Sin cobertura abierta en absoluto. Ninguna publicación de esta recopilación trata noticias, herramientas o lanzamientos de generación de imágenes o vídeo de código abierto: la ausencia es total, no parcial.
YouTube
YouTube — Noticias de IA de generación de imágenes y vídeo (código cerrado / código abierto)
Canales
Canales encontrados mediante resultados de búsqueda de YouTube y búsquedas de noticias. En muchos casos no se pudieron verificar directamente los suscriptores porque las páginas de vídeo se renderizan con JavaScript (véanse los detalles en ## Límites).
- Theoretically Media — canal habitual que prueba en ComfyUI IA generativa abierta como Wan, FLUX y Qwen-Image. («Wan 2.2, FLUX & Qwen Image Upgraded: Ultimate Tutorial...» https://www.youtube.com/watch?v=3BFDcO2Ysu4)
- Matt Wolfe / The Next Wave — conocido por comparativas de herramientas cerradas como Runway, Kling, Veo y Sora.
- Varios canales personales de herramientas de IA que publican reseñas individuales de LTX-2.5, MiniMax H3 y Nano Banana 2; en los resultados de búsqueda solo se verificaron títulos de vídeo, no los nombres de sus canales.
Vídeos
Sistemas cerrados
- «Nano Banana 2 Is INSANE – Full Test of Google's New Image Model!» — aproximadamente 2026-02-26 — https://www.youtube.com/watch?v=k0dujOUePeU — Prueba Gemini 3.1 Flash Image de Google, conocido como Nano Banana 2, y afirma que resuelve el equilibrio entre velocidad y calidad de imagen.
- «Nano Banana 2 vs Nano Banana Pro: I Tested Both So You Don't Have To» — finales de febrero de 2026 — https://www.youtube.com/watch?v=B1d3SIfoQLk — Compara los resultados de la versión estándar y Pro para determinar cuál conviene utilizar.
- «Kling 3.0 Surprised Me! Compared To Veo 3.1 & Sora 2» — aproximadamente 2026-02-05 — https://www.youtube.com/watch?v=AAD7wJ3DWiA — Compara directamente Kling 3.0 de Kuaishou con Veo 3.1 y Sora 2, y concluye que compite bien en realismo y movimiento de cámara.
- «Is Kling 3.0 Actually Good? (I Spent $500 Testing For You)» — aproximadamente 2026-02-04 — https://www.youtube.com/watch?v=Rme22R7a9O8 — Prueba mediante uso de pago las capacidades multishot y salida 4K a 60 fps de Kling 3.0.
- «Seedream 5.0 Tested & Seedance 2.5 Leaks Are Unreal!» — aproximadamente 2026-07-15 — https://www.youtube.com/watch?v=pn-YwWn3kkM — Prueba el modelo de imagen Seedream 5.0 Pro de ByteDance y el aún no anunciado Seedance 2.5; menciona que ByteDance saltó Seedance 2.1.
- «Seedance 2.5 Is Insane — 30 Seconds In ONE Shot?» — aproximadamente 2026-06-23 — https://www.youtube.com/watch?v=8sGVhuoPOXI — Examina la capacidad de Seedance 2.5 para generar 30 segundos de vídeo continuo en una sola toma.
- «MiniMax H3 Review | Testing Hailuo's New 2K AI Video Model» — principios de agosto de 2026 — https://www.youtube.com/watch?v=67CCQBAwZiA — Prueba MiniMax H3 (Hailuo 3.0), lanzado el 2026-07-31, y confirma 2K, 15 segundos y audio estéreo nativo.
- «Hailuo AI's NEW MiniMax H3 Model Is INCREDIBLE! (Full Test)» — alrededor de agosto de 2026 — https://www.youtube.com/watch?v=la0iBk8g8_g — Prueba a fondo las funciones omnimodales de MiniMax H3, que admiten simultáneamente texto, imagen, vídeo y audio.
- «FLUX 3 Sneak Peek» — 2026-07-23 — https://www.youtube.com/watch?v=PCPhl8qMF_Y — Presentación anticipada de FLUX 3 de Black Forest Labs, un sistema multimodal de imágenes, vídeo de 20 segundos, audio y acciones; la función Video llegó a disponibilidad general el 2026-08-04.
- «Gen-4.5 Updates — Research Demo Day 2025 | Runway» — 2025-12-16 — https://www.youtube.com/watch?v=yNXxuzmiwEo — Explicación oficial de Runway sobre actualizaciones técnicas de Gen-4.5, incluido el control de cámara y la consistencia de personajes.
- «All in one AI | Text to Image & Video AI | Kling, Veo, Sora, Nano Banana Pro | Daily Free Credits!» — reciente — https://www.youtube.com/watch?v=SnmRpf_VfgU — Vídeo que explica cómo usar conjuntamente varias IA cerradas —Kling, Veo, Sora y Nano Banana Pro— mediante sus cuotas gratuitas diarias.
Sistemas abiertos
- «LTX 2.5 In ComfyUI — Setup, First Gens, And The Catch» — mediados de agosto de 2026 (unas tres semanas después de la publicación de los pesos abiertos de LTX-2.5 el 2026-08-11) — https://www.youtube.com/watch?v=RjlbDhs1MPk — Integra de forma nativa en ComfyUI el modelo mundial LTX-2.5 de 22B de Lightricks y confirma una velocidad de 6,8 segundos para generar diez segundos de vídeo a 720p.
- «LTX 2.5 ComfyUI: Physics Test vs MiniMax H3 + Free Workflows» — hace unas tres semanas — https://www.youtube.com/watch?v=WpKNXZZqQEU — Enfrenta directamente el modelo de pesos abiertos LTX-2.5 con el no abierto MiniMax H3 en física y múltiples tomas.
- «New LTX 2.5 Video Model is INSANELY Fast (ComfyUI Local)» — hace unas tres semanas — https://www.youtube.com/watch?v=pA2BQw9LY8A — Prueba centrada en la velocidad de ejecución local.
- «Wan 2.2, FLUX & Qwen Image Upgraded: Ultimate Tutorial for Open Source SOTA Image & Video Gen Models» — Theoretically Media — https://www.youtube.com/watch?v=3BFDcO2Ysu4 — Explica en ComfyUI Wan 2.2 (modelo de vídeo MoE), FLUX, FLUX Krea y Qwen Image. Considera que Wan 2.2 se acerca a Sora en consistencia y que FLUX sobresale en detalle.
- «HunyuanImage 3.0 — The Most Powerful Open-Source Image Generator Yet» — 2025-09-30 — https://www.youtube.com/watch?v=U-8RjjU7x14 — Presenta el modelo de imagen MoE de 80B de parámetros de Tencent. Señala una ligera ventaja en tasa de victorias frente a Seedream 4.0, Nano Banana y GPT-Image.
- «Flux.2 Dev: Full Review, Pros & Cons, ComfyUI Setup!» — aproximadamente 2025-11-26 — https://www.youtube.com/watch?v=MoAwonm53hQ — Reseña y configuración en ComfyUI de FLUX.2 de Black Forest Labs, incluida su versión de pesos abiertos. Destaca que puede mantener la consistencia del sujeto usando hasta diez imágenes de referencia.
- «FLUX 2 Released! 🤯 ComfyUI Install, Workflow & The "Active Parameter" Secret» — aproximadamente 2025-11-26 — https://www.youtube.com/watch?v=nfeDS_EoblE — Guía de instalación de FLUX.2 en ComfyUI y explicación de las nuevas funciones.
- «Qwen Image First Look & LOCAL Testing (The BEST New Image Model?)» — 2025-08-05 — https://www.youtube.com/watch?v=ex2YCqtTHSY — Primera prueba local de Alibaba Qwen-Image, antecesor del posterior Qwen-Image-2512.
- «Qwen Image Edit 2511–Local Image Editing in ComfyUI | Multi-Reference Style Transfer & GGUF Workflow» — 2025-12-26 — https://www.youtube.com/watch?v=iFnTqZmsRIc — Prueba la transferencia de estilo con múltiples imágenes de referencia de Qwen Image Edit usando un flujo GGUF de ComfyUI.
- «MiniMax H3: The New Open-Source Video Champ?» — alrededor de agosto de 2026 — https://www.youtube.com/watch?v=3R5GROj8Tcg — Presenta MiniMax H3 como modelo de vídeo omnimodal de pesos abiertos y menciona su valoración como número uno en un ranking de edición de vídeo.
Señales
- Los pesos abiertos se acercan rápidamente a la vanguardia: LTX-2.5 (2026-08-11) y MiniMax H3 (2026-07-31) se publicaron con pesos abiertos durante los últimos 60 días. Destacan miniaturas comparativas que plantean que, en vídeo, igualan o superan a MiniMax H3 de código cerrado. Los proyectos abiertos ya no van «a remolque»: se convierten en referencias de comparación desde el momento de su lanzamiento.
- Ciclo de lanzamiento rápido de ByteDance: Seedream 5.0 Pro y Seedance 2.5 —con salto de la versión 2.1— se actualizan cada pocos meses; las pruebas de YouTubers tienen un claro tono de actualidad inmediata, con términos como «Tested» y «Leaks».
- Reorganización del ecosistema de Google: toda la línea Imagen está prevista para retirarse el 2026-08-17 y continúa la transición hacia Nano Banana, la familia Gemini 3.x Image. Incluso Nano Banana 2 (2026-02-26) ya cuenta con múltiples vídeos de comparación frente a sus sucesores, incluido Pro.
- Retirada de un gran actor cerrado: OpenAI cerrará la API de Sora el 2026-09-24 y planea reasignar recursos de cómputo al siguiente modelo, «Spud» (según resultados de búsqueda; no se verificó un vídeo de YouTube). Es un punto de inflexión importante para la evolución de los modelos cerrados.
- ComfyUI se convierte en la base práctica de validación abierta: casi todos los vídeos sobre modelos abiertos como Wan, FLUX, Qwen-Image y LTX-2.5 se explican junto con instrucciones de instalación en ComfyUI.
Límites
- Las páginas de resultados de YouTube (
youtube.com/results?...) y de vídeo (youtube.com/watch?v=...) se renderizan con JavaScript. Incluso al recuperarlas directamente, solo se obtuvo la navegación del pie de página, sin datos brutos de visualizaciones, suscriptores o fecha (ytInitialData, etc.). Por ello, las fechas se estimaron a partir de fragmentos de buscador y referencias relativas como «hace 3 semanas»; no se pudieron confirmar visualizaciones ni suscriptores de la mayoría de vídeos. - No se encontró un vídeo de YouTube directo sobre el cierre de Sora y su sucesor «Spud»; el elemento se basa en menciones de artículos de noticias. No se verificaron vídeos de reacción en YouTube.
- Para Runway Gen-4.5 y actualizaciones recientes de Midjourney se hallaron vídeos de anuncio oficiales, pero esta búsqueda no encontró pruebas recientes de revisores independientes dentro de los últimos 60 días.
- Se verificaron enlaces a reseñas individuales de Nano Banana Pro, con títulos como «Nano Banana Pro… wtf», pero no se pudieron obtener el nombre del canal ni las visualizaciones.
Bluesky
Bluesky — Últimas tendencias de IA de generación de imágenes y vídeo
Cuentas
- Simon Willison @simonwillison.net — desarrollador conocido por evaluar LLM y modelos de imagen. Cada vez que aparece un modelo nuevo publica comparativas con su habitual «benchmark de imágenes de pelícanos». Sus publicaciones reciben muchas respuestas y son una buena fuente primaria de noticias sobre modelos cerrados.
- fofr @fofr.ai — especialista en prompts de imagen, activo en el entorno de Replicate. Publica con frecuencia usos prácticos de Nano Banana Pro (Gemini 3 Pro Image).
- Replicate (oficial) @replicate.com — cuenta oficial de la empresa de alojamiento de API de modelos de IA. Anuncia cada modelo añadido a Replicate y funciona como fuente rápida de lanzamientos de modelos de vídeo, tanto cerrados como abiertos.
- Amanda Silberling (periodista de TechCrunch) @amanda.omg.lol — periodista que cubre los aspectos culturales de la generación de imágenes por IA.
- AI News Updates @ai-latestnews.bsky.social — cuenta bot que publica automáticamente noticias de la industria de IA.
- gigowat @gigowat.bsky.social — cuenta que comparte en Bluesky artículos del sitio japonés de noticias tecnológicas GIGAZINE. Es una de las pocas fuentes de noticias de IA de generación de imágenes en japonés.
- ostris @ostris.com — desarrollador de la herramienta abierta de entrenamiento LoRA «AI-Toolkit». Publica sobre modelos de la familia Flex, pero según él mismo «la comunidad de IA/ML sigue casi toda en Twitter», por lo que actualiza poco en Bluesky.
Publicaciones
-
Simon Willison — Publicó una cuadrícula comparativa de imágenes de pelícanos de GPT-6 Astra y GPT-5.6 Sol/Terra/Luna (comparativa de modelos de imagen OpenAI cerrados). 2026-09-04, 👍91 · 🔁6 · 💬12.
https://bsky.app/profile/simonwillison.net/post/3mupxubgrls2c
También publicó una versión a tamaño completo de las imágenes generadas; incluso el texto alternativo fue generado por GPT-5-astra. 👍23.
https://bsky.app/profile/simonwillison.net/post/3mupxztoyqs2c -
Simon Willison — Comparativa de una imagen de pelícano generada con Google Gemini 3.7 Flash. 2026-09-02, 👍6.
https://bsky.app/profile/simonwillison.net/post/3muitt5g3q22r -
fofr — Compartió detalles de prompt para recrear renderizados de estilo videojuego retro con Nano Banana Pro (Gemini 3 Pro Image). 2026-01-19, 👍31.
https://bsky.app/profile/fofr.ai/post/3mcrt3avp222p
Ese mismo día publicó también un prompt para generar capturas tipo Street View. 👍10.
https://bsky.app/profile/fofr.ai/post/3mcrilugr5c2m -
Replicate (oficial) — Anunció que «GPT Image 2» de OpenAI está disponible en Replicate. Destacó su fotorrealismo, precisión al renderizar texto y fortaleza para UI y diseño (modelo cerrado). 2026-04-21.
https://bsky.app/profile/replicate.com/post/3mjzygaefs224 -
Replicate (oficial) — Anunció la disponibilidad general del modelo de generación de vídeo «Seedance 2.0» de ByteDance. Integra texto, imagen, vídeo y audio en una escena y genera audio estéreo sincronizado (modelo cerrado). 2026-04-09.
https://bsky.app/profile/replicate.com/post/3mj3junhvnh26 -
Replicate (oficial) — Añadió Gen-4.5 de Runway a Replicate: un modelo de generación de vídeo que enfatiza el realismo físico (modelo cerrado). 2026-02-18.
https://bsky.app/profile/replicate.com/post/3mf5fbf6u4l2c -
Replicate (oficial) — Añadió Kling 3.0 (+o3) de Kuaishou a Replicate, con soporte para múltiples tomas en 4K y audio sincronizado (modelo cerrado). 2026-02-17.
https://bsky.app/profile/replicate.com/post/3mf35lkhoyw2q -
Replicate (oficial) — Añadió el modelo de vídeo «Vidu Q3» a Replicate. Admite generación desde texto, imagen y fotogramas inicial/final, hasta 16 segundos a 1080p (modelo cerrado). 2026-03-11.
https://bsky.app/profile/replicate.com/post/3mgsan3ddpl2w -
Amanda Silberling (TechCrunch) — Publicación solicitando comentarios de expertos sobre por qué las imágenes de comida generadas por IA suelen tener una estética particular; una petición de fuentes sobre las peculiaridades estéticas de la IA de imagen. 2026-08-28, 👍17 · 🔁5 · 💬4.
https://bsky.app/profile/amanda.omg.lol/post/3mu5itcncgc2x -
AI News Updates (bot) — Informó de que «Midjourney Inc. compró la aplicación de astrología Co-Star y lanzará una nueva app de generación de imágenes». 2026-07-25. El contenido coincide con reportes de TechCrunch y Bloomberg (2026-07-24, que indicaban que la adquisición se cerró en primavera), por lo que se pudo corroborar.
https://bsky.app/profile/ai-latestnews.bsky.social/post/3mrh6gdxnqy2s -
gigowat (compartición en japonés de un artículo de GIGAZINE) — Compartió un artículo de GIGAZINE que prueba el rendimiento para ilustraciones y texto japonés de «Qwen-Image-3.0», IA abierta de generación de imágenes. 2026-07-22.
https://bsky.app/profile/gigowat.bsky.social/post/3mr7dvb332z2q
(Artículo original: https://gigazine.net/news/20260722-qwen-image-3/ ) -
ostris — Anunció el lanzamiento de «Flex.2-preview», modelo abierto de generación de imágenes que integra texto a imagen, control universal e inpainting. Es una publicación algo antigua, de 2025-04-22, pero uno de los pocos ejemplos de un desarrollador de modelos abiertos comunicando directamente en Bluesky. 👍4.
https://bsky.app/profile/ostris.com/post/3lngo5cf66k2a
Señales
- Predominio de modelos cerrados: las publicaciones con interacción real en Bluesky se concentraron en grandes modelos cerrados de GPT, Gemini (Nano Banana Pro) y Midjourney. El «benchmark de imágenes de pelícanos» de Simon Willison funciona como un control periódico de calidad de modelos cerrados.
- La cuenta de Replicate es un centro de avisos de vídeo: las principales novedades de vídeo de 2026 —Kling 3.0, Seedance 2.0, Runway Gen-4.5 y Vidu Q3— llegaron una tras otra desde la cuenta oficial de Replicate. Aunque cada publicación recibió pocos me gusta (1–2), resultó útil para seguir el orden cronológico de los lanzamientos.
- La comunicación de código abierto es escasa en Bluesky: apenas se encontraron menciones primarias de modelos importantes de pesos abiertos de 2026 como Wan 2.7, HunyuanVideo 1.5, Chroma o LTX-2.3. El desarrollador ostris incluso escribió que «la comunidad de IA/ML sigue casi toda en Twitter», lo que sugiere que la comunidad se concentra en X.
- Las publicaciones en japonés se centran en compartir noticias de GIGAZINE: las publicaciones japonesas encontradas proceden principalmente de artículos de sitios de noticias como gigowat, sin análisis primario independiente.
Límites
- La API oficial de búsqueda de publicaciones de Bluesky (
app.bsky.feed.searchPosts) devolvió siempre403 Forbiddendesde la herramienta WebFetch de esta sesión. No se pudo hacer una recopilación exhaustiva por palabras clave con métricas de me gusta y republicaciones. En consecuencia, la investigación pasó a revisar los feeds de cuentas conocidas encontradas mediante Google usandogetAuthorFeed;getProfile,getAuthorFeed,getPostThready oEmbed funcionaron correctamente. - La página de búsqueda de
bsky.appes una SPA renderizada con JavaScript, por lo que WebFetch, que solo convierte HTML a Markdown, no pudo recuperar el texto de las publicaciones. - Debido a estas limitaciones no se pudo revisar de forma exhaustiva cada publicación de un modelo concreto; se filtraron las publicaciones pertinentes de feeds recientes de cuentas destacadas. En total se revisaron más de 20 publicaciones y feeds, pero solo unas 12 estaban directamente relacionadas con IA de imagen o vídeo.
- Para modelos abiertos como Wan, HunyuanVideo, Chroma, Z-Image y LTX-2.3 se probaron varias cuentas, sin hallar publicaciones pertinentes de 2026. hugggingface.bsky.social tenía un feed vacío y civitai-bot.bsky.social no se actualizaba desde mayo de 2024.
- Se encontró una publicación individual de febrero de 2026 que sugería que Midjourney se había convertido en parte de Meta.ai, pero las fuentes externas confirmaron que en realidad se trataba de un acuerdo de licencia de agosto de 2025 y que Midjourney seguía siendo independiente. Por ser inexacta, no se incluyó en este informe.
Lemmy
Lemmy — Últimas tendencias de IA de generación de imágenes y vídeo (cerrado/abierto)
Comunidades
- !«メールアドレス» — 5.708 personas. Discusión técnica de modelos abiertos de generación de imágenes y vídeo. Fue la comunidad con mayor densidad informativa de toda la investigación.
- !«メールアドレス» — 2.360 personas. Espacio para obras creadas con modelos de Stable Diffusion; contiene pocas noticias propiamente dichas.
- !«メールアドレス» — 1.593 personas. Dedicada al arte de IA de estilo anime; poco orientada a noticias.
- !«メールアドレス» — 50 personas. Comunidad bot que replica automáticamente RSS de Reddit. Debe tenerse presente que no refleja debate humano.
- !«メールアドレス» y !«メールアドレス» — comunidades de noticias tecnológicas generales. Los resultados específicos de IA de generación de imágenes y vídeo fueron escasos y quedaron enterrados entre artículos de IA general.
- No existe en Lemmy una gran comunidad dedicada exclusivamente a IA de generación de imágenes o vídeo, comparable a r/StableDiffusion de Reddit; la conversación se reparte entre comunidades pequeñas.
Publicaciones
Sistemas abiertos
- MiniMax H3: Comfy se convierte en revendedor oficial de licencias comerciales — !«メールアドレス», puntuación 4, 2026-08-28. Artículo original: https://blog.comfy.org/p/comfy-is-now-the-only-official-reseller . MiniMax H3 es un modelo de vídeo de pesos abiertos publicado en agosto de 2026, capaz de ejecutarse localmente incluso con una GPU de clase RTX 3060 y generar vídeo 2K con audio estéreo nativo. Comfy se convirtió en distribuidor de licencias comerciales (Professional/Enterprise), y Enterprise permite usar incluso el modelo no destilado.
- LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes — !«メールアドレス», puntuación 2, 2026-09-04. https://arxiv.org/abs/2609.03796 . Modelo de imagen con receta de entrenamiento totalmente pública, puntuación de primer nivel en Qwen-Image-Bench y una rápida variante Turbo destilada.
- Trellis.2 y Pixal3D se integran de forma nativa en ComfyUI — !«メールアドレス», puntuación 4, 2026-09-01. https://blog.comfy.org/p/trellis2-and-pixal3d-are-now-native . El anuncio afirma que «los mejores modelos abiertos de generación 3D ahora forman parte del núcleo de ComfyUI».
- ComfyUI-MiniMaxH3-CLSS — !«メールアドレス», puntuación 0, 2026-09-01. https://github.com/nazgut/ComfyUI-MiniMaxH3-CLSS . Herramienta para MiniMax H3 que promete generación de vídeo con audio de duración arbitraria incluso en equipos de consumo con 16 GB de VRAM.
- Fizgig LoRA/LoKR Studio — !«メールアドレス», puntuación 4, 2026-08-30. https://github.com/shootthesound/Fizgig . Herramienta abierta para entrenar y extraer LoRA/LoKR para varias familias de modelos, incluidas Krea 2, MiniMax y Klein 9B.
- VibeVoice-ComfyUI (integración en ComfyUI del TTS abierto de Microsoft) — !«メールアドレス», puntuación 1, 2026-08-28. https://github.com/nikhilprasanth/VibeVoice-ComfyUI . Un ejemplo de la incorporación de audio a flujos de generación de vídeo.
- Boogu-Image-0.1 — Efficient Image Generation Foundation Model — !«メールアドレス», puntuación 5, 2026-06-17. Modelo base abierto de generación de imágenes centrado en ligereza y eficiencia.
Sistemas cerrados
- Midjourney pivota de la generación de imágenes por IA a los escáneres médicos por ultrasonido — !«メールアドレス», puntuación 58, 2026-06-18. https://lemmy.zip/post/66397234 . Hubo muchos hilos relacionados, incluidos espejos de Hacker News con puntuaciones de 40 o más, bajo términos como «Midjourney Medical» y «Ultrasonic CT». Fue una de las mayores noticias como cambio de dirección de un servicio establecido de imagen cerrada.
- Midjourney exige a los estudios de Hollywood una divulgación detallada sobre el uso de IA — !«メールアドレス», puntuación 73, 2026-07-05. https://lemmy.today/post/56011946
- Lanzamiento del nuevo modelo de imagen de Google «Nano Banana 2 Lite» — !«メールアドレス», puntuación 0, 2026-07-02. https://lemmy.world/post/48936394(espejo de hackernews: https://lemmy.bestiver.se/post/1199483 )
- MAI-Image-2.5 de Microsoft se acerca a Nano Banana 2 de Google en benchmarks — !«メールアドレス», puntuación 1, 2026-05-28. https://lemmy.durstig.online/post/35068
- Reseña comparativa práctica de Seedream 5.0 Pro — !«メールアドレス», puntuación 1, 2026-07-10. https://lemmy.durstig.online/post/46063
- Runway anuncia que su negocio empresarial se duplicó y que su retención neta de ingresos supera el 300 % — !«メールアドレス», puntuación 0, 2026-08-30. https://lemmy.durstig.online/post/56937
- La función Earth AI de Google se retiró discretamente un día después de su lanzamiento por problemas de generación NSFW — !«メールアドレス», puntuación 1, 2026-08-07. https://lemmy.durstig.online/post/52162
Señales
- El lado abierto está dominado por MiniMax H3: cerca de la mitad de las publicaciones de finales de agosto y principios de septiembre en la comunidad stable_diffusion se relacionan con MiniMax H3 —generación de vídeo, ejecución local incluso en una RTX 3060 y audio—, además de extensiones y herramientas de aceleración para ComfyUI. Parece encaminarse a ser un estándar de facto de vídeo abierto.
- La frontera entre abierto y cerrado se difumina: MiniMax H3 tiene «pesos abiertos», pero el uso comercial exige una licencia de pago a través de Comfy. Es una señal de que se consolida un modelo híbrido: uso gratuito, pero comercial de pago.
- La mayor noticia cerrada fue una retirada: la noticia de que Midjourney dejaba la generación de imágenes para orientarse a equipos médicos consiguió puntuaciones de 58 a 73 y eclipsó las noticias de competencia entre modelos. El cambio de actividad de un gran actor cerrado generó mucha más atención.
- La generación 3D también se integra en ComfyUI: modelos abiertos de texto/imagen a 3D como Trellis.2 y Pixal3D se incorporan al núcleo de ComfyUI, lo que lleva la generación de activos 3D a los flujos locales junto a imágenes y vídeo.
- Lemmy no cuenta con una comunidad grande específica de IA de imagen y vídeo: la conversación se reparte entre comunidades técnicas de Stable Diffusion de unos miles de personas y comunidades bot pequeñas como ai_reddit, con solo 50 suscriptores.
Limitaciones
- Lemmy es federado y su API de búsqueda solo cubre el índice de una instancia. Así, las búsquedas con la API de
lemmy.worldomiten publicaciones de otras instancias comolemmy.dbzer0.comylemmy.today. Se combinaron API y búsquedas de múltiples instancias, pero el resultado no es exhaustivo. - La comunidad
localllamadelemmy.mldevolvió 404 al consultar directamente la información de comunidad (/api/v3/community), por lo que no se pudieron verificar sus detalles. !«メールアドレス»es una comunidad bot que replica mecánicamente el feed RSS de Reddit, con 50 suscriptores y casi sin debate humano. Puede servir como fuente de noticias, pero no como indicador del interés de la comunidad de Lemmy.- Las búsquedas directas de servicios cerrados de generación de vídeo —Sora, Kling AI, Veo y Runway Gen— devolvieron principalmente resultados irrelevantes, como lugares, nombres o noticias generales. Solo se encontró una publicación sobre Runway vinculada a resultados financieros.
- El volumen de publicaciones es muy pequeño comparado con Reddit: las puntuaciones suelen estar entre un dígito y unas decenas. Lemmy por sí solo no ofrece una muestra suficiente para hablar de tendencias tras leer 20 publicaciones; se ejecutaron siete consultas en varias instancias y se seleccionaron ejemplos representativos de las publicaciones reales encontradas.
Pinterest — Noticias de IA de generación de imágenes y vídeo
Temas visuales
- El estilo de «miniatura de YouTube / imagen destacada de blog» es abrumadoramente mayoritario. Fondos negros o azul marino, degradados de neón azul, morado y naranja, y titulares en sans serif muy gruesa como «AI NEWS», «THE FUTURE IS AI», «BREAKING NEWS» y «AI IS CHANGING EVERYTHING!». Hay más portadas de artículos o vídeos sobre IA que obras generadas en sí mismas [2, 7, 11, 38, 39, 42, 48]
- Los rostros y retratos humanos son el motivo central. Animación de expresiones, sincronización labial, recreación de caras (Microsoft VASA-1) y sesiones de retrato con IA (ChatGPT+Higgsfield) aparecen repetidamente como usos de «animar o generar caras» [13, 14, 18, 23, 50]
- Los humanoides y robots se usan como símbolo genérico de la IA. Abundan imágenes de stock sin relación con herramientas concretas, como perfiles de robots blancos o mujeres de aspecto ciborg [2, 39]
- Composiciones de cuadrícula «antes/después» o «una imagen de entrada → múltiples estilos». Hay cuadrículas comparativas que transforman vídeo real en madera, origami, bloques LEGO o flores, y composiciones que sitúan personajes de peluche en fondos realistas [3, 31]
- Infografías de comparación y ranking de herramientas. Destacan listas con logotipos, comparativas entre «mejor calidad de pago» y «mejor opción gratis», o tablas de funciones con marcas de verificación [7, 37]
- Miniaturas con rostros que recuerdan a celebridades reales. Retratos generados similares a Jeff Bezos, presentadores tipo YouTuber con el texto «AI NEWS» y fotos de conferencias de Jensen Huang de NVIDIA se usan para transmitir confianza o captar atención [11, 36, 40]
- Superposiciones de malla facial y wireframe. Cuadrículas y etiquetas numéricas sobre caras y cuellos, evocando análisis de expresiones o biometría, se utilizan en pines publicitarios [23, 50]
- Paleta de color coherente. La base oscura con acentos neón cian, magenta y amarillo se ha convertido en el lenguaje visual común de casi todos los pines de herramientas de IA [2, 7, 38, 39, 42]
Pines destacados
- [1] Image to Video AI: How It Works and Why It Matters — Imagen destacada de un artículo explicativo que ilustra cómo una imagen estática se convierte en una «línea temporal de vídeo» de múltiples fotogramas.
- [3] Google announces ultra-high quality video... (en realidad, una demostración de transformación de estilo con preservación de identidad, del tipo Luma) — Cuadrícula 3×5 que transforma un vídeo original en madera, origami, LEGO, flores y otros materiales. Es una demostración clara de cómo mantener la consistencia de la misma persona y vehículo mientras cambia solo la textura.
- [7] 6+ Best AI Video Generation Websites — Infografía guardable que enumera Runway, Pika, Kling AI, Luma AI (Dream Machine), Canva AI y Hailuo AI con funciones, usuarios objetivo y disponibilidad de plan gratuito.
- [10] Veo 2 — Pin promocional de Google para VideoFX. Combina cortes realistas de una persona mirando por un microscopio, un nadador bajo el agua y una mujer animada bailando con constelaciones, condensando diversos estilos visuales en una sola imagen.
- [14] Veo 3 Image-to-Video: Fast Generation & Native Audio via Gemini API — Imagen promocional que indica que es posible generar vídeo desde imagen a través de Gemini API y enfatiza el soporte de audio nativo.
- [23] Microsoft Unveils VASA-1 — Tecnología que genera vídeos de caras parlantes, expresivos y casi en tiempo real a partir de una sola foto, un clip de audio y señales de control opcionales. La miniatura reúne múltiples rostros y expresiones.
- [27] ShengShu Technology Unveils Vidu S1 — Pin de anuncio de Vidu S1, de ShengShu Technology, que promete «generación interactiva en tiempo real», con un personaje de estética ciberpunk.
- [31] Google announces video generation AI 'Veo 3' — Conjunto de cuatro ejemplos que integran una imagen de entrada —un peluche de monstruo morado— en una sala de servidores realista, ruinas submarinas y una ciudad de caramelos.
- [33] 'Amuse 3.0', an AI art creation tool — Anuncio de una nueva versión de la herramienta local de generación artística de AMD, basada en Stable Diffusion. Es una de las pocas señales concretas de enfoque local o abierto en un conjunto dominado por modelos cerrados.
- [42] Breaking News Latest AI Developments — Recopilación de tres noticias: capacidades de agente de Grok 4.6, Gemini superando mil millones de usuarios —con 150 millones de imágenes generadas al día— y el teléfono robot de Honor (fechado el 12 de agosto de 2026).
Señales
- Los actores cerrados destacan de forma evidente. Grandes anuncios de Google Veo 2/Veo 3, Microsoft VASA-1, OpenAI, Grok 4.6 y Gemini superando mil millones de usuarios aparecen directamente como material para pines. En cambio, nombres abiertos habituales como Stable Diffusion, ComfyUI, Flux, Wan, HunyuanVideo y LTX casi no aparecen en las imágenes muestreadas, salvo Amuse 3.0 [33], herramienta local de AMD. Pinterest probablemente está más orientado a contenido de recopilación y comparación para consumidores y marketing que a comunidades técnicas.
- Concentración en usos para animar o crear «caras». Sincronización labial, reproducción de expresiones, sustitución de sesiones de retrato y vídeos de IA estilo presentador de noticias se repiten. Parece ser resultado del cruce entre la demanda de Pinterest —belleza, mejora personal e ideas para redes sociales— y el marketing de vídeo con IA.
- Predominan los resúmenes secundarios frente a fuentes primarias. Hay más miniaturas de «cara de presentador + texto de titular» e infografías comparativas que capturas de resultados reales de modelos. Pinterest funciona más como puerta de entrada a artículos de blog, vídeos de YouTube y enlaces de afiliados que como lugar de difusión de anuncios primarios.
- Señal de ausencia: no se encontraron, dentro de la muestra, pines que mencionaran publicaciones japonesas o empresas japonesas —por ejemplo, startups de IA o servicios nacionales de generación de vídeo—. Las herramientas y noticias anglófonas ocupan casi todo el espacio.
Límites
- De los 50 elementos de
output/pinterest.pins.md, se abrieron realmente 24 imágenes para revisar el contenido, seleccionadas buscando representatividad. De las otras 26 se revisó solo el título y se infiere que caen en los mismos patrones visuales —infografías, retratos y comparativas de herramientas— observados en las imágenes abiertas. - Ocho pines no tenían título, apareciendo como «(untitled)» ([12, 19, 20, 30, 35, 39, 46, 50]). Se inspeccionaron las imágenes [39] y [50], pero no las restantes.
- Los datos recopilados por el trabajador no contenían división por categorías;
pinterest.pins.mdes una lista plana, por lo que no se preparó un desglose por género. - Pinterest no se navegó directamente durante esta fase: siguiendo el playbook, el análisis se basó solo en imágenes y títulos recopilados previamente. Los datos no incluían métricas de interacción, como me gusta, guardados o comentarios.
Acciones recomendadas
- Repetir la búsqueda en X con términos explícitos de modelos y herramientas —Stable Diffusion, ComfyUI, Flux, Wan, Kling y Sora— en lugar de depender de la lista de tendencias.
- Crear una lista permanente de cuentas conocidas de Bluesky para consultarlas mediante getAuthorFeed, ya que
app.bsky.feed.searchPostsdevolvió 403 en esta ejecución. - Señalar explícitamente los modelos híbridos abiertos/comerciales como MiniMax H3, en vez de incluirlos bajo una única etiqueta de código abierto.
- Mantener un seguimiento periódico de pivotes y cierres de grandes proveedores —el giro médico de Midjourney y el fin de vida de la API de Sora— porque atrajeron más atención que los lanzamientos de producto puros en Reddit y Lemmy.
- Considerar Pinterest como un medidor de percepción del consumidor, no como una fuente técnica primaria, dado que casi no cubre el código abierto.
Imágenes recopiladas


















































Nota sobre la calidad de los datos
X y Bluesky quedaron muy por debajo del objetivo de unas 20 publicaciones por plataforma (X solo mostró 4 publicaciones pertinentes, todas de modelos cerrados; la API de búsqueda de Bluesky devolvió 403, por lo que la cobertura dependió de cuentas conocidas). Reddit, Lemmy y YouTube también recopilaron menos elementos de los previstos, y YouTube no pudo confirmar las visualizaciones ni los suscriptores debido a sus páginas renderizadas con JavaScript.



