KEN’S CAT LOG

Noticias de IA de generación de imágenes y vídeo — 2026-09-04

El código cerrado avanza hacia la integración de generación, edición y audio en un solo modelo (FLUX 3, Kling 3.0), mientras que el código abierto ve cómo laboratorios chinos (Alibaba, Tencent) siguen lanzando mensualmente modelos Apache 2.0 de bajo consumo de VRAM; la propia frontera entre ambos bandos se está difuminando mediante licencias híbridas como las de FLUX 3 y MiniMax H3.

Noticias de IA de generación de imágenes y vídeo — 2026-09-04

El sector de código cerrado ha pasado de la «competición puntual por la calidad de imagen» a una fase de «integración de generación, edición y audio en un único modelo» (FLUX 3 incluso añade predicción de acciones). Google Nano Banana Pro prácticamente domina en generación de imágenes, mientras OpenAI retirará la aplicación Sora en marzo de 2026, mostrando un panorama desigual. En el sector de código abierto, laboratorios chinos encabezados por Alibaba (Wan/Qwen-Image/Z-Image) y Tencent (Hunyuan) lanzan modelos Apache 2.0 casi cada mes, y están penetrando en la comunidad de ComfyUI con el argumento de que «funcionan en GPU de consumo». La frontera entre ambos sectores se está volviendo borrosa: destacan formatos híbridos como «se anuncia como pesos abiertos, pero en la práctica es acceso temprano cerrado» (FLUX 3) o «los pesos son abiertos, pero una empresa posee la venta exclusiva de licencias comerciales» (MiniMax H3). Sin embargo, de las seis plataformas investigadas, Reddit fue completamente inaccesible, Bluesky no devolvió ni una sola conversación sobre los modelos más recientes de 2026, y Pinterest apenas aportó hallazgos sobre código abierto; por ello, este informe se sostiene en la práctica sobre tres pilares: X, YouTube y Lemmy.

Hallazgos transversales entre plataformas

  • X y YouTube coinciden en que FLUX 3 «no es abierto». El nuevo modelo de Black Forest Labs integra imágenes, vídeo, audio y predicción de acciones, pero tanto el anuncio de @bfl_ai como la observación de @kimmonismus indican explícitamente que es «gated early access, not open source», y el vídeo explicativo de ElevenLabs en YouTube (https://www.youtube.com/watch?v=WlGmDRLZt9o) recalca deliberadamente el mismo punto.
  • X, YouTube y Lemmy coinciden en que el principal frente del código abierto se concentra en laboratorios chinos. Alibaba (Wan2.2/2.6/2.7, Qwen-Image, Z-Image-Turbo) y Tencent (HunyuanVideo 1.5, HunyuanImage 3.0) publican modelos nuevos casi mensualmente, y en !«メールアドレス» de Lemmy la creación de nodos de ComfyUI para estos modelos aparece casi a diario.
  • Que «funcione en una GPU de consumo» es un argumento de venta compartido por el código abierto. Z-Image-Turbo (16 GB de VRAM, @stevenhoi) y HunyuanVideo 1.5 (14 GB, vídeo de TensorArt https://www.youtube.com/watch?v=MJShdc8tkkA) se presentan en X y YouTube con las mismas cifras.
  • La retirada de la aplicación Sora quedó respaldada desde ángulos distintos en YouTube y Lemmy. YouTube (NBC News https://www.youtube.com/watch?v=6e3SINmPii4, Wall Street Millennial https://www.youtube.com/watch?v=ZkRYH6PEP5k) informó sobre preocupaciones por deepfakes y pérdidas financieras, mientras que Lemmy (republicación vía https://www.reddit.com/r/ArtificialInteligence/comments/1tovuid/, 2026-05-27) aportó el caso concreto de un proyecto cinematográfico de IA de 30 millones de dólares que se vino abajo.
  • X y Lemmy confirman que las clasificaciones de arena (Artificial Analysis / Arena.ai) se han convertido en la «vara común» de los anuncios. Todo anuncio de un modelo nuevo, cerrado o abierto, incluye su posición en la arena, y @ArtificialAnlys en X desempeña un papel de verificación transversal.
  • X (FLUX 3) y Lemmy (MiniMax H3) aportan ejemplos distintos de la difuminación de la frontera entre abierto y cerrado. MiniMax H3 tiene pesos abiertos (MiniMax Community License), pero Comfy vende en exclusiva la licencia comercial (https://blog.comfy.org/p/comfy-is-now-the-only-official-reseller), un formato híbrido que rompe una división binaria sencilla.
  • Las propias restricciones de acceso a las plataformas fueron el mayor obstáculo común de esta investigación. El acceso directo a Reddit, a la API de búsqueda de Bluesky y a las páginas principales de YouTube fue bloqueado, de modo que cada fase tuvo que depender de información indirecta obtenida mediante WebSearch.

Por plataforma

Reddit — No se pudo acceder en absoluto a reddit.com, sus espejos ni archive.org, por lo que la fase terminó con cero publicaciones. Artículos periféricos mencionaban indirectamente que «Wan 2.5 generó interés en r/StableDiffusion» o que «r/SoraAi buscó alternativas tras el cierre de Sora», pero no se adoptaron como hechos al no poder abrirse las fuentes primarias.

X — Se confirmaron 21 publicaciones; fue la plataforma con más información del informe. Al combinar anuncios primarios de cuentas oficiales (xAI, Runway, Alibaba_Wan, Alibaba_Qwen, TencentHunyuan, bfl_ai, Kling_ai) con verificaciones de observadores del sector como Artificial Analysis y rohan_paul, fue posible presentar 12 hallazgos de código cerrado y 9 de código abierto. Sin embargo, al no haber inicio de sesión, apenas pudieron obtenerse métricas de interacción como me gusta o reposts.

YouTube — La búsqueda mediante WebSearch funcionó de forma estable y permitió confirmar 11 vídeos de código cerrado y 11 de código abierto, 22 en total, con sus títulos, canales y contenido. En cambio, el acceso a las páginas de vídeo estaba limitado y no fue posible comprobar reproducciones, suscriptores ni comentarios.

Bluesky — Solo se localizaron 10 publicaciones (4 de código cerrado y 6 de código abierto), la mayoría procedentes de comunidades aficionadas de Civitai/Stable Diffusion de 2024 a la primera mitad de 2025. No apareció ni una sola publicación sobre nombres de modelos principales de 2026 como Wan2.6, Qwen-Image-2512, Kling 3.0 o FLUX 3. Tampoco se confirmaron cuentas oficiales de laboratorios: era un «mundo aparte» desconectado del ciclo de noticias de X. La principal causa parece ser que la propia API de búsqueda estaba bloqueada con un error 403.

Lemmy — Se confirmaron 13 publicaciones. !«メールアドレス» (unas 5.600 personas) funcionó como principal frente del código abierto y ofreció abundantes temas prácticos relacionados con ComfyUI, como MiniMax H3, LTX-2.3/2.5 y Boogu-Image-0.1. En el lado cerrado, las publicaciones sobre controversias y litigios —retirada de Sora, demanda por CSAM de Grok y críticas a DLSS5— lograron mejores puntuaciones que los anuncios de modelos nuevos.

Pinterest — Se revisaron como imágenes 32 de los 50 Pines recopilados. La mayoría eran infografías de «comparativas de las mejores herramientas» centradas en grandes marcas de código cerrado (Google Veo, Sora, Runway, Kling, Midjourney, etc.); en la práctica, no había Pines que trataran código abierto (Stable Diffusion, Flux, Wan, HunyuanVideo, etc.). También había varios Pines cuyo título y contenido visual no coincidían, lo que confirmó que es menos útil que las otras plataformas para noticias de última hora.

Qué vigilar a continuación

Acciones recomendadas

  • Monitorizar continuamente X y YouTube como fuentes primarias de novedades de código cerrado.
  • Usar !«メールアドレス» de Lemmy como observatorio fijo del ecosistema ComfyUI para las tendencias de implementación de código abierto.
  • Para Reddit y Bluesky, preparar en la próxima ronda otros medios de acceso, como sesiones con inicio de sesión o claves de API oficiales; de lo contrario, no podrá realizarse una investigación útil.
  • Pinterest no es adecuado para noticias de última hora; la próxima vez conviene limitarlo al análisis de tendencias visuales, como miniaturas y paletas.
  • Clasificar los casos que se autodenominan «pesos abiertos» pero en realidad emplean licencias cerradas o híbridas (FLUX 3, MiniMax H3) únicamente después de comprobar la redacción de la licencia en cada caso.
  • Añadir revisiones periódicas de Lemmy, ya que las noticias legales o polémicas, como la retirada de Sora o la demanda contra Grok, tienden a aportar antes que X ejemplos concretos con cantidades y documentos judiciales.

Calidad de los datos

Reddit tuvo cero publicaciones debido al bloqueo técnico de acceso, por lo que no se obtuvo ningún conocimiento sobre este tema en esa plataforma. La API de búsqueda de Bluesky estaba bloqueada con un 403 y fue necesario depender de índices obtenidos mediante WebSearch; la mayoría de las publicaciones halladas eran temas antiguos de 2024 a la primera mitad de 2025 y no mencionaban los principales modelos de 2026. Pinterest apenas ofreció hallazgos concretos sobre código abierto (solo AMD Amuse 3.0) y se inclinó hacia infografías genéricas centradas en código cerrado. X, YouTube y Lemmy confirmaron más de 20 publicaciones, vídeos o hilos reales cada una en conjunto y constituyen la base principal de este informe.

Resumen por plataforma

Reddit

Reddit — Noticias de IA de generación de imágenes y vídeo (código cerrado / código abierto)

Dónde

En esta fase no se pudo acceder en absoluto a reddit.com, por lo que no se pudo confirmar qué subreddits estaban realmente activos en este tema, incluidos sus números de suscriptores. Hay subreddits que normalmente se asocian con este campo (r/StableDiffusion, r/midjourney, r/aivideo, r/SoraAi, r/singularity, etc.), pero al no poder abrirse en esta ocasión, no pueden informarse como «lugares confirmados».

Qué dice la gente

En el entorno de herramientas de esta investigación no se pudo abrir ni una sola publicación de Reddit. Por tanto, hubo cero hallazgos concretos acompañados de «enlace a la publicación + número de votos positivos + fecha». No se pudo realizar ni el análisis de 5 a 12 publicaciones solicitado por el playbook ni el de unas 20 publicaciones requerido por el encargo.

Lo siguiente es contenido que otros sitios (blogs y artículos recopilatorios) mencionaron indirectamente mediante WebSearch como «esto se está diciendo en Reddit». Al no haberse abierto ni verificado directamente, no se adopta como hecho y queda solo como nota de referencia:

  • Un artículo recopilatorio indicaba que un hilo sobre Wan 2.5 en r/StableDiffusion había reunido cientos de votos positivos y comentarios, que se valoraba su generación nativa de audio y que había muchas peticiones de publicar pesos abiertos, pero no pudieron confirmarse ni la URL del hilo ni el número real de votos positivos.
  • Otro artículo afirmaba que, cuando OpenAI cerró la aplicación Sora el 26 de abril de 2026, aumentaron rápidamente en r/SoraAi las publicaciones preguntando «¿cuál es la alternativa?», pero tampoco se pudo abrir la fuente primaria.
  • También se encontró una afirmación de que «ByteDance Seedance 2.0 se convirtió en una publicación viral con más de 12.300 votos positivos en r/aivideo», pero no se verificaron ni el enlace ni la fecha.

Como estos datos no proceden de una lectura real de Reddit, no deben utilizarse en el cuerpo del informe (con un mínimo de 10 hallazgos para código cerrado y otros 10 para código abierto).

Señales

No se recopilaron señales procedentes de Reddit. Como mucho, los temas citados por artículos periféricos —generación nativa de audio de Wan 2.5, reacciones al cierre de Sora y atención a Seedance 2.0— ofrecen únicamente una indicación de segunda mano de que «parecen ser tema de conversación en Reddit». Deberían verificarse directamente en las fases de otras plataformas (X, YouTube, etc.) y no pueden contabilizarse como resultados de esta fase.

Límites
  • Todo acceso directo a reddit.com falló. Se probaron www.reddit.com (incluida la página principal) y old.reddit.com mediante WebFetch, pero ambos fueron rechazados con el bloqueo «Claude Code is unable to fetch from ...».
  • También fallaron los espejos/proxies: redlib.catsarch.com → HTTP 403, libreddit.spike.codes → error de resolución DNS, teddit.net → bloqueado de igual modo.
  • También se intentó obtener instantáneas históricas de Reddit a través de web.archive.org, pero el acceso a archive.org estaba bloqueado.
  • WebSearch se probó más de diez veces con site:reddit.com y consultas que incluían nombres concretos de subreddits o títulos de hilos (por ejemplo, "site:reddit.com r/StableDiffusion new open source model", "Wan 2.5 open source video model reddit thread discussion release", etc.), pero nunca devolvió una URL real de reddit.com. Los resultados de búsqueda se sustituían sistemáticamente por fuentes secundarias como Wikipedia, blogs de empresas, Substack o Hugging Face; podían resumir que «se dice X» sobre hilos de Reddit, pero no incluían ningún enlace verificable.
  • Como resultado, no se cumplieron ni los «enlaces reales con número de votos positivos y fecha» requeridos por el playbook ni el criterio de finalización del encargo, «análisis de unas 20 publicaciones».
  • Conclusión: en esta fase, Reddit fue una plataforma efectivamente cerrada (nothing to give). Se recomienda recopilar señales sociales alternativas en las fases de X, YouTube, Bluesky, Lemmy y Pinterest.

X

X — Noticias de IA de generación de imágenes y vídeo

Como X (antes Twitter) no puede leerse sin iniciar sesión, el contenido de publicaciones individuales y sus URL se ha recogido mediante búsquedas externas site:x.com. Casi todas las publicaciones proceden de cuentas oficiales (xAI, Runway, Alibaba_Qwen, Alibaba_Wan, TencentHunyuan, bfl_ai, Kling_ai, ideogram_ai, etc.) o de observadores y agregadores del sector como Artificial Analysis, Rohan Paul y LudovicCreator.

Cuentas y hashtags

Fuentes de código cerrado

  • @xai — Avisos sobre Grok Imagine / la retirada de grok-2-image-1212, entre otros
  • @runwayml — Fuente primaria de Gen-4 y Gen-4.5
  • @Kling_ai — Anuncio de Kling 3.0
  • @bfl_ai (Black Forest Labs) — FLUX 3 (actualmente más cercano al código cerrado por su acceso temprano cerrado)
  • @ideogram_ai — Anuncios de despliegues con socios
  • @ArtificialAnlys (Artificial Analysis) — Publica continuamente las posiciones de arena de cada modelo. Es una cuenta de referencia que sigue conjuntamente modelos cerrados y abiertos

Fuentes de código abierto

  • @Alibaba_Wan / @AlibabaGroup — Información primaria sobre Wan2.1/2.2/2.6
  • @Alibaba_Qwen — Qwen-Image / Qwen-Image-2512
  • @Ali_TongyiLab — Z-Image / Z-Image-Turbo
  • @TencentHunyuan — HunyuanImage 2.1/3.0, HunyuanVideo 1.5 y Hunyuan-GameCraft
  • @stevenhoi (Tongyi-MAI) — Anuncio personal de la publicación de Z-Image-Turbo
  • @rohanpaul_ai — Publica con frecuencia hilos explicativos sobre modelos abiertos chinos
  • Hashtags/términos de búsqueda: #OpenSource, #Wan22, #QwenImage, numerosas menciones de licencia Apache 2.0
Publicaciones
Código cerrado
  1. Posiciones de arena de GPT Image 2 / MAI-Image-2.6@ChanPerco: informa de que GPT-Image 2 quedó primero y MAI-Image-2.6 de Microsoft segundo, por delante de Grok Imagine 2.0. (Fecha desconocida; publicación de la segunda mitad de 2026. Las métricas de interacción no son públicas en el texto.)
  2. MAI-Image-2.6 entra en el tercer puesto de la arena@testingcatalog: «MAI-Image-2.6 scored in the 3rd spot on Image Arena and is now available on MAI Playground and Microsoft Foundry in private preview.»
  3. El misterioso modelo «duct-tape»@arrakis_ai: un modelo anónimo de prueba, aparentemente basado en GPT, se volvió tema de conversación en la arena. «Holy shxt… The rules of AI image generation just completely changed.» Se señaló un salto notable en la precisión de renderizado de texto nativo.
  4. Cambio generacional de los modelos de generación de imágenes de Grok@daisuke: anuncia el retiro de «grok-2-image-1212 model effective Feb 28, 2026» y la transición a grok-imagine-image (cita un anuncio oficial de xAI).
  5. Modelo de vídeo xAI Imagine v0.9@xai: «Introducing Imagine v0.9, our new video generation model with massive upgrades from v0.1 in visual quality, motion, audio generation», desplegado gratuitamente en todos los productos.
  6. Runway Gen-4.5@runwayml: anunciado como nuevo modelo base tras lograr 1.247 Elo en la arena de texto a vídeo. La empresa publicó después Gen-4.5 Image to Video («Built for longer stories. Precise camera control. Coherent narratives.»).
  7. Anuncio de Kling 3.0@Kling_ai: bajo el lema «Everyone a Director», anuncia una arquitectura todo en uno que integra generación, edición y audio en un modelo y permite generar clips de 15 segundos. El creador francófono @tardquin también lo reposteo como noticia de última hora.
  8. Mención de la economía de Kling 3.0@CNBizInsider: analiza que «could fundamentally reshape video AI economics».
  9. Ejemplo de uso de Nano Banana Pro (Google)@101babich: hilo con ejemplos de tres patrones de uso en diseño de productos.
  10. Comparación Nano Banana estándar vs. Pro@immasiddx: publicación comparativa de la diferencia de calidad entre los modelos nuevo y anterior, acompañada de «We're cooked 💀»; también señala deficiencias anatómicas, como la representación de dedos.
  11. FLUX 3 llega como modelo cerrado@kimmonismus: Black Forest Labs anunció «FLUX 3», que integra imágenes, vídeo, audio y predicción de acciones, pero especificó «The current release is gated early access, not open source».
  12. Anuncio oficial de FLUX 3 Video@bfl_ai (información primaria de la propia empresa): «One multi-modal model for Image, Video, Audio and Action-Prediction», con vídeo de 20 segundos y diálogos multilingües. En una publicación posterior presume de que «FLUX 3 Video is #2 in the world» y lo ofrece gratis durante un tiempo limitado.
Código abierto
  1. Lanzamiento oficial de Wan2.2@Alibaba_Wan (oficial): «The World's First Open-Source MoE-Architecture Video Generation Model with Cinematic Control!». La cuenta personal @scaling01 también lo difundió de inmediato.
  2. Wan2.6: genera vídeo y audio en una sola pasada@FutureStacked: «the first open-source model that generates video AND audio together in a single pass. No stitching. No external tools.»
  3. Publicación de Wan2.2-Animate@Alibaba_Wan: modelo integrado para animación y sustitución de personajes. «model weights and inference code are now open-source for the entire community!»
  4. Publicación de Qwen-Image@Alibaba_Qwen (oficial): modelo MMDiT de 20.000 millones de parámetros, promocionado con «SOTA text rendering — rivals GPT-4o in English». @rohanpaul_ai añadió que «Runs under Apache 2.0 so anyone can deploy it for free».
  5. Qwen-Image-2512 (actualización de regalo de Año Nuevo)@Alibaba_Qwen: publica resultados propios de benchmark: «Tested in 10,000+ blind rounds on AI Arena, Qwen-Image-2512 ranks as the strongest open-source».
  6. Qwen-Image-Layered@azed_ai: sorpresa ante la función de edición por separación de capas: «natively breaks images into editable parts, not masks, not hacks 🤯».
  7. HunyuanVideo 1.5@TencentHunyuan (oficial): se autodenomina «the strongest open-source video generation model» y enfatiza que sus 8.300 millones de parámetros pueden funcionar en GPU de consumo con 14 GB de VRAM.
  8. HunyuanImage 3.0@TencentHunyuan: «the largest and most powerful open-source text-to-image model to date, with over 80 billion total parameters».
  9. Publicación de Z-Image-Turbo@stevenhoi (miembro del equipo Tongyi-MAI): publica un modelo de 6.000 millones de parámetros con «sub-second inference speed on consumer gpu w/ 16GB VRAM». A la semana siguiente, Artificial Analysis lo reconoció como número uno de imagen con pesos abiertos, y Arena.ai confirmó su entrada en el ranking con licencia «Apache 2.0».
Señales
  • El principal frente del código abierto se concentra en laboratorios chinos: Alibaba (Wan / Qwen-Image / Z-Image) y Tencent (Hunyuan) lanzan nuevos modelos cada pocas semanas. En X se ha consolidado el ciclo «anuncio → verificación independiente → nueva clasificación en arena» por Artificial Analysis y cuentas individuales de la comunidad.
  • El sector cerrado pasa de la «competición puntual por la calidad» a la «integración y creación de ecosistemas»: Kling 3.0 y FLUX 3 se orientan ambos a integrar generación, edición y audio en un único modelo; FLUX 3 añade además predicción de acciones y robótica. Los resultados de búsqueda también señalaban que «the AI generator era is already ending, with competitors racing to own the whole process».
  • Se difumina la frontera entre abierto y cerrado: FLUX 3 de Black Forest Labs se anuncia como «Open-weight», pero comenzó realmente como acceso temprano cerrado y prometió pesos abiertos para una fecha posterior. Es un ejemplo llamativo de la brecha entre el texto de un anuncio y la realidad. No debe clasificarse algo como «código abierto» solo por su redacción: es necesario comprobar cada vez la licencia, en particular si es Apache 2.0.
  • El principal campo de batalla de los benchmarks es la arena de Artificial Analysis: tanto para modelos cerrados como abiertos, las cifras de «qué posición ocupa en la arena» acompañan sistemáticamente los anuncios primarios de las empresas y funcionan como vara común entre usuarios de X.
  • Los requisitos bajos de VRAM se han convertido en argumento de venta: Z-Image-Turbo (16 GB), HunyuanVideo 1.5 (14 GB) y otros modelos abiertos recalcan una y otra vez que «funcionan en GPU de consumo», una estrategia claramente dirigida a la comunidad de ejecución local y ComfyUI.
Límites
  • Sin acceso con inicio de sesión a X, todas las publicaciones se recogieron de resultados y resúmenes de Google mediante site:x.com. Los fragmentos de búsqueda no incluían cifras concretas de interacción, como me gusta o reposts, por lo que no pudieron verificarse para la mayoría de publicaciones (solo se indican cuando el texto las menciona).
  • Las fechas exactas de publicación no pueden deducirse de los identificadores de estado; para muchas solo puede determinarse que pertenecen a 2026. No se garantiza una secuencia temporal estricta.
  • Los espejos de nitter y Threadreader no devolvieron instancias válidas en esta búsqueda, por lo que no fue posible una consulta directa.
  • Midjourney (v7/funciones de vídeo), Adobe Firefly, Ideogram y otros competidores occidentales de código cerrado más allá de Runway (Luma, Pika, Stability AI) tenían escasas publicaciones primarias en X; solo aparecían en fuentes secundarias, como menciones en artículos de blog.
  • Se cumple el criterio de «unas 20 publicaciones» al presentar 21 en la sección Posts (12 de código cerrado y 9 de código abierto). Sin embargo, algunas agrupan publicaciones de seguimiento sobre el mismo tema —por ejemplo, varias de bfl_ai— como una sola entrada; en un recuento simple, se consultaron realmente más de 25 publicaciones.

YouTube

YouTube — Noticias de IA de generación de imágenes y vídeo (código cerrado / código abierto)

La página oficial de resultados de búsqueda de YouTube (youtube.com/results) requiere mucho renderizado de JavaScript y WebFetch solo pudo leer el pie de página. Por ello, se recopilaron URL de vídeos individuales mediante búsquedas WebSearch de site:youtube.com <palabra clave>, y cada vídeo se verificó de forma primaria en youtube.com/oembed?url=... (API oficial de YouTube) para su título y nombre de canal; la fecha y el contenido se respaldaron con fragmentos de WebSearch y artículos originales. No se pudieron confirmar visualizaciones ni suscriptores porque el acceso a las páginas de vídeo estaba limitado (véanse los Límites).

Canales

Canales que cubren código cerrado

  • Paul J Lipsky — Reseña de Kling 3.0
  • Theo - t3gg(t3.gg) — Análisis de Nano Banana Pro
  • NBC News — Cobertura generalista de Nano Banana Pro / Sora
  • TheAIGRID — Noticias de última hora sobre Sora 2
  • OpenArt — Práctica con Sora 2 / Wan 2.7
  • Wall Street Millennial — Análisis financiero de la retirada de Sora
  • ElevenLabs — Explicación de FLUX 3
  • ApiTechTips — Presentación de Seedance 2.5
  • LLM Master — Tutorial de Grok Imagine 0.9
  • Standarity — Explicación de Seedream 5.0 Pro

Canales que cubren código abierto

  • Codedigipt — Wan 2.6 / Z-Image Turbo
  • Sebastian Kamph — Wan 2.6 R2V
  • Omar Ortiz — Wan 2.7 Image Pro
  • Promptus AI — Z-Image frente a Flux 2
  • TensorArt — HunyuanVideo 1.5
  • AI Search — Ranking de HunyuanVideo 1.5
  • Alibaba Cloud (oficial) — Anuncio de Qwen-Image-2.0
  • kintu — Reseña de Qwen-Image-2.0
  • fal (fal Academy) — Explicación de LTX-2

No se pudieron comprobar los suscriptores de ninguno de ellos debido a las restricciones al obtener las páginas de vídeo (véanse los Límites).

Vídeos
Tendencias de código cerrado
  1. Kling 3.0: The Best AI Video Generation I've Ever Seen (Truly Incredible) — Paul J Lipsky — https://www.youtube.com/watch?v=p6cV7PitAvg — Evalúa la generación cinematográfica multishot, el audio nativo y sincronización labial, y la consistencia de personajes de «Kling 3.0» de Kuaishou como «lo mejor que ha visto hasta ahora».
  2. Google won image generation (it's not even close) NANO BANANA PRO BREAKDOWN — Theo - t3gg — https://www.youtube.com/watch?v=UV9GqinedQ8 — Sostiene que Nano Banana Pro (Gemini 3 Pro Image) de Google prácticamente domina la competencia de generación de imágenes.
  3. Google's Nano Banana Pro is raising concerns over realistic AI image generation — NBC News — https://www.youtube.com/watch?v=RmmrVCUGYp8 — Un medio generalista informa sobre el riesgo de abuso derivado del realismo de Nano Banana Pro.
  4. OpenAI's Sora 2 Just SHOCKED The Entire Industry! (10 Things To Know About Sora 2) — TheAIGRID — https://www.youtube.com/watch?v=y4RCSU6SsA0(2025年10月1日) — Explica la precisión de la simulación física de Sora 2 (gimnasia, saltos con triple giro, etc.) y el impacto de su despliegue como aplicación social.
  5. Sora 2 Just Got An Update.....And? — OpenArt — https://www.youtube.com/watch?v=WmJrfuY8BXc — Evalúa con escepticismo que la actualización de Sora 2 no avanzó tanto como se esperaba.
  6. OpenAI is shutting down its Sora video creation app — NBC News — https://www.youtube.com/watch?v=6e3SINmPii4(2026年3月25日) — Informa del cierre de la aplicación independiente de Sora junto con preocupaciones por deepfakes.
  7. OpenAI Shuts Down Sora After Losing Billions — Wall Street Millennial — https://www.youtube.com/watch?v=ZkRYH6PEP5k — Analiza la retirada de Sora desde la perspectiva financiera de pérdidas enormes.
  8. FLUX 3 Is Here — Everything You NEED to Know — ElevenLabs — https://www.youtube.com/watch?v=WlGmDRLZt9o(2026年7月23日発表直後) — Aclara que FLUX 3 de Black Forest Labs, que integra imagen, vídeo, audio y predicción de acciones, es «gated early access» y actualmente no es código abierto.
  9. ByteDance Seedance 2.5: 30-Second AI Video Generation with 50 Reference Inputs — ApiTechTips — https://www.youtube.com/watch?v=O2KNqKLANtQ — Presenta Seedance 2.5, anunciado en Volcano Engine FORCE el 23 de junio de 2026, con generación de 30 segundos, 4K y disponibilidad mediante API cerrada.
  10. GRATIS Grok Imagine 0.9. Crea videos en 20 segundos. — LLM Master — https://www.youtube.com/watch?v=ScWkfsrDAkw — Explica que Grok Imagine v0.9 de xAI abrió gratuitamente a todos los usuarios su generación de vídeo sincronizada con audio.
  11. ByteDance Seedream 5.0 Pro: The Announcement, Read and Highlighted — Standarity — https://www.youtube.com/watch?v=g05iPef37Qs(2026年7月) — Desglosa el anuncio de Seedream 5.0 Pro, un nuevo modelo de imagen que permite edición parcial por capas.
Tendencias de código abierto
  1. Wan 2.6 Just Changed AI Video Forever 😱 — Codedigipt — https://www.youtube.com/watch?v=gYcMhT-eZ_A(2025年12月16日) — Presenta la conservación de identidad de personajes de Alibaba Wan 2.6 y la división automática en múltiples ángulos desde un único prompt.
  2. Wan 2.6 is HERE! R2V is AWESOME! — Sebastian Kamph — https://www.youtube.com/watch?v=dGDIpQz_l-E(2025年12月21日) — Demuestra la función Reference-to-Video (R2V) y recalca que sus pesos abiertos tienen licencia Apache.
  3. Taking Wan 2.7 For A Ride! Here's What I Found Out — OpenArt — https://www.youtube.com/watch?v=RERsGjQrQ6E(2026年4月) — Reseña práctica de Wan 2.7; la compara con Kling 3 y Veo 3.1 y valora que sea gratuita y sin censura.
  4. Wan 2.7 Image Pro: The AI Image Model Nobody Saw Coming — Omar Ortiz — https://www.youtube.com/watch?v=GIMVt4vCv20(2026年5月) — Señala que Wan se está fortaleciendo rápidamente no solo en vídeo sino también en generación de imágenes.
  5. Z Image Turbo (FREE): This Open-Source AI Changed Image Generation Forever! (Like nano banana pro) — Codedigipt — https://www.youtube.com/watch?v=sPQQPpQ9X4E — Presenta Z-Image-Turbo (Apache 2.0) de Alibaba Tongyi-MAI como comparable a Nano Banana Pro.
  6. New Open-Source Model DESTROYS Flux 2 — Z-Image + Promptus Tutorial — Promptus AI — https://www.youtube.com/watch?v=JF4Q5hXh-_Q — Comparativa de benchmark que sostiene que Z-Image supera a Flux 2.
  7. Tencent HunyuanVideo 1.5 has been officially open-sourced! — TensorArt — https://www.youtube.com/watch?v=MJShdc8tkkA(2025年12月) — Explica que el modelo DiT de 8.300 millones de parámetros funciona con 14 GB de VRAM en una GPU de consumo y permite uso comercial bajo Apache 2.0.
  8. We have a new #1 open-source AI video generator! — AI Search — https://www.youtube.com/watch?v=6EQP8-D37bs — Posiciona HunyuanVideo 1.5 como el nuevo campeón de la generación de vídeo de código abierto.
  9. 🚀 Introducing Qwen-Image-2.0 — our next-gen image generation model! — Alibaba Cloud (canal oficial) — https://www.youtube.com/watch?v=NGkwBn0ebYk(2026年2月10日) — Anuncio primario de un modelo de 7.000 millones de parámetros que integra generación y edición, con resolución 2K nativa y tipografía mejorada.
  10. "Qwen Image 2.0 Review: Insane Image & Text Rendering + Editing Beast!" — kintu — https://www.youtube.com/watch?v=dxLDvd1a_Sk(2026年2月16日) — Verificación independiente de la representación de texto y el rendimiento de edición de Qwen-Image-2.0.
  11. LTX-2 Is Here - Native Audio AND Open-Source! | fal Academy — fal — https://www.youtube.com/watch?v=Odkj4zllsZg — Presenta LTX-2 de Lightricks como «el primer modelo con pesos abiertos que genera audio y vídeo sincronizados en la misma pasada», con 4K/50 fps nativo y código de entrenamiento publicado.
Señales
  • El código abierto tiene su principal frente en China (Alibaba Wan/Qwen/Tongyi-MAI, Tencent Hunyuan) e Israel (Lightricks LTX-2). Todos los canales los presentan frente a modelos cerrados mediante palabras clave como «Apache 2.0», «gratis» y «sin censura (uncensored)»; títulos como "DESTROYS" y "Nobody Saw Coming" son frecuentes, lo que sugiere que los modelos abiertos están captando atención por sus capacidades reales.
    En 2026 se están produciendo casi mensualmente vídeos de reseña de nuevos modelos abiertos: Wan 2.6→2.7, HunyuanVideo 1.5, Z-Image (Turbo), Qwen-Image-2.0 y LTX-2.
  • El sector cerrado está poblado por Google (Nano Banana Pro), OpenAI (Sora 2), Kuaishou (Kling 3.0), ByteDance (Seedance/Seedream), xAI (Grok Imagine) y Black Forest Labs (FLUX 3), y las empresas compiten por afirmar que son «número uno en la arena». Sin embargo, los vídeos muestran que la aplicación independiente Sora de OpenAI se retiró en marzo de 2026 (NBC News, Wall Street Millennial), lo que indica que incluso algunos actores cerrados tienen dificultades para monetizar.
  • FLUX 3 es un tema situado en la frontera entre cerrado y abierto. Black Forest Labs era conocido por su orientación hacia pesos abiertos, pero FLUX 3 es «gated early access», y el vídeo explicativo de ElevenLabs destaca específicamente ese hecho: señal de que la comunidad presta atención al retroceso de su apertura.
  • Los canales de reseñas (Codedigipt, OpenArt, Sebastian Kamph, Promptus AI) publican comparaciones de modelos cerrados y abiertos en el mismo formato cada vez que aparece un modelo nuevo. Por sus títulos se percibe que la audiencia elige no por plataforma, sino por «cuál es gratis y cuál ofrece mayor rendimiento».
Límites
  • No fue posible verificar visualizaciones ni suscriptores. Al obtener youtube.com/watch?v=... con WebFetch, el Markdown devuelto contenía únicamente navegación del pie de página de YouTube (condiciones, enlaces de copyright, etc.) y una nota de «el contenido es demasiado largo y ha sido truncado», sin llegar a datos principales como reproducciones, fecha de publicación o suscriptores. Las «views» y los «subscriber counts» requeridos por el playbook no podían obtenerse en este entorno.
  • Como alternativa, se verificaron únicamente el título y el nombre de canal mediante youtube.com/oembed?url=...&format=json (API oficial de YouTube). En muchos casos, la fecha se infirió de fragmentos de WebSearch —artículos originales y fuentes secundarias—, no de la propia página del vídeo. En los vídeos cuya fecha no pudo confirmarse, se omitió en el texto.
  • También se intentaron espejos de Invidious (yewtu.be), pero devolvieron una comprobación de bot (CAPTCHA), sin contenido principal. El intento de obtener la API interna mediante el parámetro pbj=1 solo devolvió JSON vacío.
  • No fue posible revisar en absoluto los comentarios, incluidos los principales, porque no se podía obtener la página principal del vídeo.
  • La búsqueda mediante WebSearch de site:youtube.com devolvía de forma estable unos diez enlaces por consulta; no era una situación de plataforma cerrada como la fase de Reddit. Al contrario, había muchos vídeos y los 11+11 seleccionados son ejemplos representativos, elegidos deliberadamente para ajustarse al límite de 5 a 12 establecido por el playbook. Se considera cumplido el requisito de «analizar unas 20 publicaciones» con la confirmación de títulos, canales y contenido de 22 vídeos: 11 cerrados y 11 abiertos.

Bluesky

Bluesky — Noticias de IA de generación de imágenes y vídeo

La API oficial de búsqueda de Bluesky (public.api.bsky.app/xrpc/app.bsky.feed.searchPosts) rechazó todo acceso desde este entorno con 403 Forbidden. Como bsky.app también es una SPA renderizada con JavaScript, abrirla directamente no permitía obtener el texto, los me gusta ni los reposts (véanse los ## Límites). Por ello, se recopilaron publicaciones reales a partir de fragmentos de páginas bsky.app indexadas por Google mediante WebSearch. Como resultado, no apareció ninguna publicación de Bluesky con nombres de modelos recientes de la segunda mitad de 2026, como Wan2.6, Qwen-Image-2512, Kling 3.0, FLUX 3, GPT Image 2, MAI-Image-2.6, Z-Image-Turbo, HunyuanImage 3.0 o Runway Gen-4.5. A diferencia de X (output/x.md), Bluesky tiene una presencia muy limitada en este tema.

Cuentas
  • @simonwillison.net — Investigador independiente que sigue LLM e IA generativa en general. Menciona ocasionalmente modelos de generación de imágenes, pero no es una cuenta especializada.
  • @todaystopainews.bsky.social — Cuenta bot/agregadora que recopila y publica automáticamente noticias de IA.
  • @civitai-bot.bsky.social (bot de actualizaciones CivitaiCheckPoint) — Bot que publica automáticamente checkpoints nuevos o actualizados de Civitai. Es la única cuenta constante que sigue el ecosistema de modelos de código abierto de Stable Diffusion.
  • @doctordiffusion.bsky.social — Creador individual que publica modelos de Stable Diffusion en Civitai.
  • @luok.ai — Cuenta individual que menciona modelos de vídeo abiertos relacionados con SkyReels (Skywork AI).
  • @dahara1.bsky.social — Cuenta individual que publica en japonés experiencias de pruebas beta de IA generativa.
  • @valeoai.bsky.social (Valeo.ai) — Cuenta que publica como código abierto investigación sobre vídeo/modelos de mundo para conducción autónoma. Se centra en publicaciones académicas abiertas, no en generación de imagen/vídeo propiamente dicha.
  • @midjourney.bsky.social — El perfil oficial de Midjourney existe, pero la búsqueda no encontró publicaciones recientes recuperables.
  • @opensource.bsky.social (Open Source Initiative) — Cuenta divulgativa de código abierto en general; no se especializa en IA de generación de imágenes o vídeo.
  • No se pudieron confirmar cuentas oficiales de Bluesky de Alibaba (Wan/Qwen-Image), Tencent (Hunyuan), Kling/Kuaishou, Black Forest Labs, Runway, xAI u OpenAI, laboratorios que en X son fuentes primarias.
Publicaciones
Código cerrado
  1. Detección SynthID de Nano Banana Pro@simonwillison.net: menciona que al subir una foto para determinar si es generada por IA, puede detectarse la marca de agua invisible SynthID incrustada por Nano Banana Pro. Fecha desconocida (se estima dentro de 2026). No se obtuvieron me gusta/reposts (véanse los Límites).
  2. Convergencia de funciones de proveedores de API y adopción de FLUX@simonwillison.net: señala que los principales proveedores de API LLM se están alineando en ejecución de código, búsqueda web, bibliotecas documentales, generación de imágenes y MCP, y menciona «image generation (FLUX for Mistral)», es decir, que Mistral adopta FLUX de Black Forest Labs para generar imágenes. Fecha desconocida.
  3. Ejemplo de producción real con Kling AI 1.6@planet-gay-comic.bsky.social (2025-02-07): publicación que revela que para la obra «Spring Feelings Arise» se usó Kling AI 1.6 para imagen a vídeo, SD-1.5 para imágenes fijas y Suno AI v4 para audio. Es un ejemplo concreto de una herramienta cerrada de generación de vídeo integrada en el flujo de producción de un creador individual.
  4. Comentario sobre el futuro de Grok@wilkos.bsky.social (2026-06-05): comentario general: «Grok will lead the way in frontier models by training off more established and capable competitors». No está centrado en generación de imágenes o vídeo y se incluye solo como referencia a modelos frontera de Grok.
Código abierto
  1. Difusión de «IA local de generación de imágenes sin censura»@todaystopainews.bsky.social (2026-06-30): publicación automática de noticias de IA: «New top local AI image generator is here! Already uncensored». Es una republicación en Bluesky de un vídeo de YouTube sobre un modelo de generación de imágenes con pesos abiertos ejecutable localmente; debe tenerse en cuenta que no es una fuente primaria sino un bot agregador.
  2. Publicación de SkyReels V1@luok.ai (2025-02-18): presenta SkyReels V1 de Skywork AI como «the first open-source human-centric video foundation model». Basado en HunyuanVideo, aprende 33 tipos de expresiones y más de 400 movimientos naturales.
  3. Experiencia beta con HunyuanVideo@dahara1.bsky.social (2025-03-06): informa en japonés: «Participé en la prueba beta de la IA de generación de vídeo (HunyuanVideo) y ya pude crear vídeos a partir de una imagen (I2V)». Menciona pruebas con materiales de estilo anime.
  4. Actualización automática de checkpoints de Civitai@civitai-bot.bsky.social (2024-05-07): un bot anuncia automáticamente una actualización de «Dream Come TrueXL v4.0» (familia SDXL/SD1.5). Muestra que la comunidad de modelos SD de código abierto de Civitai sigue presente en Bluesky mediante publicaciones automatizadas.
  5. Distribución de modelo en Civitai@doctordiffusion.bsky.social (2025-01-19): comparte un modelo propio de la familia Stable Diffusion con enlace a Civitai.
  6. Código abierto de un modelo de vídeo/mundo para conducción autónoma@valeoai.bsky.social (2025-02-24): bajo «Trained on YouTube?! We used OpenDV», anuncia una publicación completa de código abierto: artículo (arXiv:2502.15672), página de proyecto, código de GitHub, pesos entrenados, receta de entrenamiento y leyes de escalado. No es generación de imagen/vídeo propiamente dicha sino un modelo de mundo más próximo a la comprensión de vídeo, pero se incluye como ejemplo de una cuenta empresarial que abre toda la pila, incluidos los pesos.
Señales
  • Las búsquedas no devuelven ningún resultado para los modelos más recientes de 2026: se realizaron más de 20 consultas con Wan2.6, Qwen-Image-2512, Kling 3.0, FLUX 3, GPT Image 2, MAI-Image-2.6, Z-Image-Turbo, HunyuanImage 3.0 y Runway Gen-4.5; ninguno de los modelos activos en X devolvió una sola publicación en Bluesky. Las conversaciones sobre este tema en Bluesky están casi totalmente desconectadas del ciclo de noticias de X.
  • Ausencia de cuentas oficiales de laboratorios: no se confirmaron cuentas oficiales de Bluesky que emitieran información primaria, como ocurre en X, para Alibaba (Wan/Qwen), Tencent (Hunyuan), Kuaishou (Kling), Black Forest Labs, Runway, xAI u OpenAI. Solo Midjourney tiene un identificador existente, pero se desconoce su actividad. No parece haber una ruta por la que los anuncios lleguen a Bluesky.
  • Los temas hallados se inclinan hacia Stable Diffusion/Civitai occidental y, además, son antiguos: la mayoría de las publicaciones recuperadas son de 2024 a la primera mitad de 2025 y se concentran en comunidades aficionadas de Civitai y Stable Diffusion, un mundo distinto de la competición liderada en 2026 por laboratorios chinos (Wan/Qwen/Hunyuan/Z-Image).
  • Viento cultural en contra en la plataforma: el curador de feeds de arte bSky.art introdujo listas de exclusión de «IA» para feeds como «Trending», y Bluesky ha declarado que no usa en absoluto el contenido de usuarios para entrenar IA generativa. Una cultura que no busca visibilizar activamente contenido generado por IA parece ser una causa de que estas conversaciones no prosperen.
  • Las pocas novedades llegan mediante bots agregadores, no como fuentes primarias: la escasa publicación hallada sobre «modelos nuevos» (@todaystopainews.bsky.social) es también una republicación de un vídeo de YouTube, no un anuncio primario del desarrollador.
  • Las menciones de analistas de IA conocidos que migraron son esporádicas: analistas conocidos que se trasladaron desde X/Twitter, como Simon Willison, solo mencionan ocasionalmente modelos de generación de imagen/vídeo dentro de conversaciones generales sobre LLM, no los siguen de forma especializada.
Límites
  • La API oficial de búsqueda de Bluesky https://public.api.bsky.app/xrpc/app.bsky.feed.searchPosts devolvió 403 Forbidden —y en parte 522— para accesos directos y a través de varios proxies CORS (allorigins.win, corsproxy.io, codetabs.com, etc.), por lo que no fue posible obtener directamente de la API el texto de publicaciones, los me gusta, los reposts ni la fecha de publicación.
  • Las pantallas de búsqueda, perfiles y enlaces permanentes de publicaciones de bsky.app son SPA renderizadas con JavaScript. El contenido obtenido era un shell de aplicación vacío, con títulos como «Bluesky» o «@handle on Bluesky». Por ello, todas las publicaciones del informe se reconstruyeron a partir de fragmentos de páginas bsky.app indexadas por Google mediante WebSearch y no se obtuvo ningún dato de me gusta o reposts (la razón por la que no se muestran cifras en la sección Posts).
  • Debido a estas restricciones, el índice del buscador de Bluesky es escaso, y para temas antiguos no devuelve prácticamente nada. Todas las consultas por modelos recientes de 2026 quedaron vacías y solo pudieron recuperarse publicaciones de 2024 a 2025. Esto no demuestra que «no haya noticias en Bluesky», sino que probablemente refleja la limitación del método de acceso de este estudio, restringido a lo visible mediante índices de búsqueda.
  • El criterio de finalización de «analizar unas 20 publicaciones» no pudo cumplirse en Bluesky por sí solo porque el acceso directo a los datos reales estaba bloqueado. Las 10 publicaciones anteriores (4 cerradas y 6 abiertas) son todas las que pudieron verificarse como existentes desde este entorno; se concluyó que para aumentar el volumen serían necesarios el inicio de sesión en la aplicación oficial u otro método de acceso a la API.

Lemmy

Lemmy — Investigación de noticias de IA de generación de imágenes y vídeo

Comunidades
  • !«メールアドレス» (aprox. 5.600–5.700 personas) — Temas generales de modelos de imagen y vídeo con pesos abiertos. Los nodos personalizados de ComfyUI y los nuevos modelos de Hugging Face aparecen casi todos los días; fue el lugar más productivo de esta investigación.
  • !«メールアドレス» (2.359 personas) — Espacio para obras creadas con Stable Diffusion/modelos de pesos abiertos.
  • !«メールアドレス» (1.593 personas) — Dedicado al arte de IA de estilo anime, limitado a SFW.
  • !«メールアドレス» (1.662 personas) — Debate sobre SD como «modelo de aprendizaje profundo de código abierto».
  • !«メールアドレス» (52 personas), !«メールアドレス» (50 personas), !«メールアドレス» (102 personas), !«メールアドレス» (96 personas) — Comunidades pequeñas por temática de nicho.
  • !«メールアドレス» (222 personas) — Espejo/comunidad alternativa de la comunidad de lemmy.dbzer0.com, con menos publicaciones.
  • !«メールアドレス», !«メールアドレス», !ai_reddit (en varias instancias), !«メールアドレス» — Aquí circulan noticias y sentimientos anti-IA acerca de IA cerrada (Grok, Sora, Nvidia DLSS, etc.). Los suscriptores no eran públicos o variaban demasiado para confirmarlos.
Publicaciones
  1. OpenAI apaga Sora; una película de 30 millones de dólares se queda en nada (!ai_reddit, 2026-05-27, puntuación 1) — https://www.reddit.com/r/ArtificialInteligence/comments/1tovuid/ . Publicación sobre un proyecto cinematográfico de IA que se derrumbó como consecuencia del final de la aplicación y API de Sora 2 (el final de la API está previsto para 2026-09-24). Relacionado: «How OpenAI scrapping Sora points to tech problems» (!openai, 2026-04-13) https://timesofindia.indiatimes.com/technology/ , «Why OpenAI abandoned Sora» (!kagismallweb, 2026-04-03) https://onemanandhisblog.com/2026/03/
  2. Se informa de que la generación de imágenes de xAI «Grok» se usó para crear 7.000 imágenes sexuales de la hija de la propia víctima, y xAI es demandada por generación de CSAM (!«メールアドレス», «Child sexual abuse survivor alleges Elon Musk's AI chatbot used photos of her to generate new illegal images», hacia finales de agosto de 2026, puntuación 119) — https://lemmy.world/post/51492879 . El comentario principal critica «la estructura en la que los multimillonarios no asumen responsabilidad».
  3. Un juez federal de EE. UU. determina que el material de abuso sexual infantil generado por IA está protegido por la Primera Enmienda (!technology, 2026-08-30, puntuación 16) — https://reason.com/volokh/2026/08/27/ . Fue republicado en varias instancias, incluida una versión en !«メールアドレス», como asunto relevante para el límite legal de la IA generativa, tanto cerrada como abierta.
  4. Nvidia DLSS 5: filtro de mejora de imagen con IA a cambio de una caída de rendimiento del 50–60 % (!«メールアドレス», 2026-09-02〜09-03, puntuación 21) — https://www.pcgamer.com/hardware/graphics-cards/dlss-5-comes-with-a-massive-50-60-percent-performance-hit/ . También fueron tema de conversación las publicaciones relacionadas «Nvidia Announces DLSS 5...An AI slop filter over your game» https://lemmy.world/post/44347792 y «Experimental Build Of Nvidia's DLSS 5 AI Slop Filter Leaks...» https://lemmy.world/post/51240561 .
  5. Publicación de Google Nano Banana 2 Lite (!swisstechnews, 2026-07-02; republicación de !hackernews, 2026-06-30) — https://www.itmagazine.ch/artikel/87529/https://deepmind.google.com/models/ 。Presentado como un modelo ligero de generación de imágenes de la familia Gemini 3.
  6. Microsoft «MAI-Image-2.5» alcanza el nivel de Nano Banana (!ai_reddit, 2026-05-28, puntuación 1) — https://www.reddit.com/r/ArtificialInteligence/comments/1tpu2cd/ 。Noticia sobre el lanzamiento por Microsoft de un modelo propio cerrado de imagen para competir con Google.
  7. Reseña comparativa fotorrealista de «Seedream 5.0 Pro» de ByteDance (!ai_reddit, 2026-07-10, puntuación 1) — https://www.reddit.com/gallery/1usc03q
  8. Adobe Firefly entra en beta pública (!swisstechnews, 2026-04-28) — https://www.itmagazine.ch/artikel/87034/ 。Sigue la discusión sobre la integración en Photoshop de un chatbot de IA y de audio generativo (!boycottus, 2025-10-29, puntuación 22 https://alternativeto.net/news/2025/10/adobe-adds-ai-chatbots-to-photoshop-premiere-ai-masking-and-generative-audio-in-firefly/ ).
  9. Debate: «¿Cuánto debemos temer a los deepfakes de IA?» (!«メールアドレス», hacia 2026-05-20, puntuación 21) — https://lemmy.world/post/47088326 。La persona autora borró todas sus fotos de internet para protegerse de los deepfakes. Los comentarios señalan que el riesgo varía según la posición de cada persona y que las mujeres afrontan un riesgo mayor.
  10. Pesos abiertos de MiniMax H3 (Hailuo 3.0) y venta exclusiva por ComfyUI de la licencia comercial (!«メールアドレス», «ComfyUI MiniMax H3 Commercial Licensing», 2026-08-28, puntuación 4) — https://blog.comfy.org/p/comfy-is-now-the-only-official-reseller 。Los pesos son abiertos (MiniMax Community License, uso comercial permitido para empresas con menos de 20 millones de dólares de facturación anual), pero Comfy vende en exclusiva la licencia comercial y el soporte de implantación: un «modelo comercial con apariencia de apertura». Gestiona texto, imagen, vídeo y audio en un solo transformador, con hasta 15 segundos, 2K y audio estéreo nativo. Hay muchas publicaciones de herramientas relacionadas (MiniMax-H3-Acc-LoRAs, MotionCache-FastVAE, Director-Cut-Studio, etc., todas entre 2026-08-28 y 09-02).
  11. Numerosos nodos de ComfyUI relacionados con LTX-2.3 / LTX-2.5 (modelos de vídeo de pesos abiertos de Lightricks) (!stable_diffusion, 2026-08-27〜09-01) — Ejemplo: https://github.com/nazgut/ComfyUI-LTX2.3-CLSS 。LTX-2.5 es un modelo abierto de vídeo con audio de 22B, con generación multishot y salida 4K HDR; antes de la llegada de H3 era líder en vídeo con pesos abiertos.
  12. Trellis.2 y Pixal3D obtienen compatibilidad nativa con ComfyUI (!stable_diffusion, 2026-09-01, puntuación 4) — https://blog.comfy.org/p/trellis2-and-pixal3d-are-now-native 。No solo la imagen y el vídeo: la generación 3D también se integra en el ecosistema ComfyUI.
  13. Publicación de Boogu-Image-0.1 (!stable_diffusion, 2026-06-17, puntuación 5) — https://boogu.org/ 。Modelo de 10B completamente abierto bajo Apache-2.0, con posiciones altas en Qwen-Image-Bench y tres variantes: Base/Turbo/Edit. Es un ejemplo representativo que afirma poder ofrecer rendimiento de nivel cerrado incluso con un presupuesto de cómputo pequeño.
Señales
  • El ambiente en el lado cerrado: el centro de conversación no son los «anuncios de modelos nuevos», sino las «controversias, demandas y retiradas». Las noticias negativas como la retirada de Sora, la demanda por CSAM de Grok y las críticas a la caída de rendimiento de DLSS5 suelen obtener mejores puntuaciones (21 puntos para DLSS5, 119 para la demanda de Grok). El sentimiento anti-IA también es fuerte en comunidades como !«メールアドレス».
  • El ambiente en el lado abierto: !«メールアドレス» se ha convertido de facto en un «registro de actualizaciones del ecosistema ComfyUI». Casi todos los días se publican nuevos nodos personalizados y LoRA relacionados con MiniMax H3, LTX-2.3/2.5, Flux y Qwen Image. Hay más publicaciones de herramientas para desarrolladores que de obras, lo que muestra una comunidad orientada a la utilidad.
  • Se difumina la frontera entre abierto y cerrado: MiniMax H3 es un formato híbrido de «pesos abiertos, pero licencia comercial vendida exclusivamente por Comfy», lo que erosiona una clasificación binaria simple.
  • En Lemmy en general hay muchas republicaciones procedentes de comunidades espejo de Reddit (!ai_reddit, etc.); la mayor concentración de publicaciones originales como fuente primaria se encuentra en !«メールアドレス».
Límites
  • Lemmy tiene una base de usuarios menor que X, YouTube o Reddit y no se encontró una comunidad dedicada exclusivamente a IA de generación de vídeo (por ejemplo, algo como !video_generation). Los temas de vídeo solo son visibles enterrados en publicaciones de herramientas dentro de comunidades de Stable Diffusion (LTX, MiniMax H3, WanGP, etc.).
  • La API de búsqueda global de Lemmy devolvía cero resultados para algunas palabras clave (por ejemplo, video generation por sí sola o búsquedas individuales de Ideogram/Seedream/Qwen Image), y no pudo distinguirse si realmente no había publicaciones o si era una limitación del índice de búsqueda.
  • El número de suscriptores de cada comunidad difería según la instancia (por ejemplo, !«メールアドレス» aparece como 5,05K/5,64K/5.707 según la fuente). Por la naturaleza de la red federada, no pudo obtenerse una única cifra exacta.
  • La página de comunidad lemmy.world/c/stable_diffusion_art devolvía un error de servidor (HTTP 500) al obtenerla directamente, y se sustituyó su lista de publicaciones por información obtenida mediante búsqueda de API.
  • No se alcanzó a examinar por completo «20 publicaciones» en una única plataforma. Este informe selecciona 13 publicaciones y enlaces reales que pudieron confirmarse mediante búsquedas por API y WebSearch; no incluye enlaces inventados.

Pinterest

Pinterest — Noticias de IA de generación de imágenes y vídeo (código cerrado / código abierto)

De los 50 Pines recopilados (output/pinterest.pins.md), se abrieron y revisaron 32 como imágenes (un único resultado de búsqueda, sin división por géneros).

Temas visuales
  • Las miniaturas clickbait procedentes de YouTube son el grupo más numeroso. Se repiten titulares en negrita de ancho completo, fotos de creadores con expresión de sorpresa y cabezas robóticas brillantes en azul neón/morado. Miniaturas de vídeo como «huge AI news», «AI NEWS» y «15 Biggest AI Updates» se han republicado directamente en Pinterest [1, 6, 8, 13, 14, 26, 47].
  • Proliferan las infografías comparativas de «Top N herramientas», incluido el reciclaje de la misma plantilla. [16] y [40] comparten el mismo diseño de «BEST QUALITY(PAID) vs BEST FREE»: ChatGPT Plus/Gemini Advanced/Midjourney/Adobe Firefly/Recraft/Runway Gen-3/Luma/Pika Pro/Kaiber/Synthesia en la columna izquierda, e Ideogram/Gemini Free/SeaArt/Playground/Krea/Canva/Inkscape/CapCut/Pika Free/Runway Free en la derecha; solo cambian el color y la marca de agua de la cuenta («DA»). Es evidencia de que se copian y producen plantillas, no información. También hay muchos Pines cuyo título y contenido visual no coinciden: [10], titulado «Top AI Video Generators of 2025», es en realidad un collage tipo moodboard cinematográfico; [42], con el título genérico «Video generation 📹», contiene un ranking «TOP 10 IMAGE-TO-VIDEO GENERATOR TOOLS» que destaca Runway e incluye Kling, Google Veo, Sora, Luma, Pika, Kaiber, Synthesia, HeyGen, Adobe Firefly e InVideo.
  • La paleta de azul marino oscuro y azul neón de «futuro tecnológico» se usa en gráficos genéricos de divulgación sobre IA, más que para noticias concretas. Cerebros luminosos, patrones de circuitos e iconos de cabezas robóticas se reutilizan como símbolos de IA en general, no solo de generación de vídeo/imágenes [2, 12, 30, 32, 36, 49].
  • Las imágenes de demostración de productos concretos son pocas, pero más específicas. Incluyen el collage multiescena de Google Veo 2 con CTA «Sign up to try on VideoFX» [5]; Veo 3 de imagen a vídeo vía la API Gemini (gráfico de embudo de entrada de imagen + texto → generación rápida) [9]; Microsoft VASA-1 (rejilla de una foto + clip de audio → cabezas parlantes con múltiples expresiones) [18]; ShengShu Vidu S1 (interfaz de personaje estilo anime que se anuncia como «modelo líder mundial para interacción de IA en tiempo real») [25]; AMD Amuse 3.0 (retrato fotorrealista de un pescador anciano acreditado como «AI generated image created on AMD Ryzen AI», una mención poco frecuente a generación local/en dispositivo) [33]; y una demostración tipo Luminate de transformación de estilo que convierte el mismo vídeo fuente en cuatro estilos —«bloques de madera», «arte de origami», «bloques de juguete coloridos» y «flores»— además de transformar el aspecto de un Tesla Model 3 y la cabeza de un panda [3].
  • Destacan Pines que visualizan desconfianza y ansiedad sobre deepfakes y detección. Una imagen superpone cifras de interacción falsas (1,2K me gusta, 7,4K reproducciones) y un sello rojo «FAKE» sobre una foto de un gato [1]; otra muestra una interfaz de detección de audio «97% likely AI generated» y unos ojos divididos entre humano y cíborg [12]; otra presenta un marcador de «Good or Bad?» para vídeo de IA con ventajas (ahorro de tiempo, bajo coste, alta calidad) y desventajas (falta de creatividad humana, falta de conexión emocional, dependencia excesiva) [19].
  • Infografías estadísticas que afirman sin fundamento el tamaño y crecimiento de mercado. «AI Video Generator Market: USD 2.56B by 2032, CAGR 20%» [48], y una lista de «6+ Best AI Video Generation Websites» con la predicción de que el 80 % del contenido online incluirá vídeo en 2026 (Runway/Pika/Kling AI/Luma AI/Canva AI/Hailuo AI) [6].
  • Pines publicitarios de «presentadores de noticias de IA» y «canales de IA sin mostrar la cara». No son noticias reales, sino miniaturas promocionales de servicios que crean vídeos tipo informativo mediante sincronización labial de IA [46].
Pines destacados
  • [3] Demostración comparativa que vuelve a transformar un vídeo fuente en cuatro estilos: «bloques de madera/origami/lego/flores», además de mostrar transformaciones de Tesla y de cabezas de panda. Es la evidencia más concreta de generación de vídeo con transformación de estilo entre las imágenes revisadas.
  • [5] Imagen de lanzamiento de Google Veo 2. Muestra en una sola imagen seis escenas muy distintas —una escena de microscopio, un nadador bajo el agua, una chica de estilo anime, flamencos, etc.— y promueve «Sign up to try on VideoFX».
  • [9] Veo 3 de imagen a vídeo mediante la API Gemini. Un gráfico con forma de embudo hace converger entrada de imagen + entrada de texto en generación rápida, sugiriendo soporte de audio nativo.
  • [18] Microsoft VASA-1. Presenta una cuadrícula que genera vídeos de cabezas parlantes con más de una docena de expresiones a partir de una sola foto y un clip de audio.
  • [25] ShengShu Vidu S1. Imagen promocional de un personaje estilo anime que se anuncia como «mejor modelo del mundo para interacción de IA en tiempo real».
  • [28] Infografía «15 Biggest AI Updates». Uno de los pocos Pines que menciona lanzamientos concretos de generación de imágenes, como funciones de edición y redimensionamiento de Grok Imagine Image 2.0, y una rebaja de precios de API de DeepSeek V4 Pro.
  • [32] Tarjeta estadística «Google analizó 15 millones de chats». Presenta el resultado de que el 86 % del uso de IA no es laboral y la anécdota de que un agente de IA superó a 458 de 526 equipos participantes en un concurso de programación.
  • [1] Imagen de un gato con sello «FAKE» y cifras de interacción falsas. Simboliza el clima de desconfianza hacia los deepfakes que atraviesa todo este conjunto de Pines.
  • [33] AMD Amuse 3.0. Retrato fotorrealista acreditado como «generado con AMD Ryzen AI», la única mención del conjunto a generación local/en dispositivo.
  • [16]/[40] El mismo gráfico comparativo de herramientas de IA «Best Quality (de pago) vs Best Free (gratuito)» aparece duplicado en dos publicaciones, con distinto color y distinta cuenta: un hallazgo que muestra la reproducción masiva de plantillas más que valor informativo.
Señales
  • Las grandes marcas de código cerrado —Google Veo, OpenAI Sora, Runway, Kling, Pika, Luma, Midjourney, ChatGPT/DALL-E y Adobe Firefly, Synthesia— se mencionan repetidamente en Pines de «Top herramientas» y son protagonistas del contenido de comparativa de herramientas en Pinterest ([6, 10, 16, 24, 40, 42], etc.).
  • Casi no existen Pines que se declaren de código abierto. Entre las 32 imágenes no apareció ninguna relacionada con modelos de pesos abiertos tradicionales, como Stable Diffusion, Flux, Wan, HunyuanVideo o pantallas de flujos de ComfyUI. Lo único remotamente cercano a lo local/en dispositivo es AMD Amuse 3.0 [33], que estrictamente no es código abierto sino una demostración local de una herramienta empresarial.
  • Son frecuentes los casos en que el título del Pin no coincide con el contenido visual real. Incluso Pines con títulos de grandes marcas, como «Google announces...» [3] o «Google announces video generation AI 'Veo 3'» [37, véanse los Límites], no muestran necesariamente logos ni evidencia de dicha marca. Es probable que sus títulos estén exagerados con fines de SEO/clickbait.
  • A menudo el contenido de los Pines que se presentan como «noticia de última hora» es en realidad una plantilla genérica y reutilizada. La maqueta «Breaking News» de [30] enumera modelos ya generalizados como GPT-5, Llama 3.1 y Claude 3.5; parece una plantilla permanente cuya fecha no se actualiza.
  • En conjunto, Pinterest se inclina hacia tres objetivos: «vender adopción y comparativas de herramientas de IA», «avivar ansiedad sobre IA» y «redistribuir miniaturas de YouTube», en vez de transmitir noticias. Para la inmediatez requerida por el encargo, otras plataformas como X y YouTube están más próximas a las fuentes primarias.
Límites
  • Se revisaron como imágenes 32 de los 50 Pines recopilados ([1, 2, 3, 5, 6, 8, 9, 10, 12, 13, 14, 16, 18, 19, 20, 24, 25, 26, 28, 29, 30, 32, 33, 36, 37, 40, 41, 42, 46, 47, 48, 49]). Los 18 restantes ([4, 7, 11, 15, 17, 21, 22, 23, 27, 31, 34, 35, 38, 39, 43, 44, 45, 50]) no se revisaron.
  • pinterest.pins.md no incluye secciones de género (## <genre>); los 50 Pines se presentan como un único resultado de búsqueda, por lo que no fue posible hacer una agregación por género.
  • Al abrir el Pin [37], titulado «Google announces video generation AI 'Veo 3'», la imagen real mostraba un personaje monstruoso morado transformado desde una imagen de entrada hacia tres entornos distintos —sala de servidores, ruinas submarinas y ciudad de caramelos—, sin logos de Google ni de Veo 3. La afirmación del título no puede sostenerse solo con la imagen y no se adoptó como hecho.
  • Solo se leyó la imagen de cada Pin; no se verificaron métricas de interacción, como guardados, comentarios o fecha de publicación en Pinterest (pinterest.pins.md tampoco contenía esa información).
  • Del mínimo requerido de 10 hallazgos de código cerrado y 10 de código abierto, Pinterest casi no proporcionó hallazgos directamente aplicables al código abierto (solo AMD Amuse 3.0 [33] guarda cierta relación). Se recomienda complementar las tendencias abiertas con las fases de X, Reddit y Lemmy.

Acciones recomendadas

  • Monitorizar continuamente X y YouTube como fuentes primarias de novedades de código cerrado.
  • Usar !«メールアドレス» de Lemmy como observatorio fijo del ecosistema ComfyUI para las tendencias de implementación de código abierto.
  • Para Reddit y Bluesky, preparar en la próxima ronda otros medios de acceso, como sesiones con inicio de sesión o claves de API oficiales; de lo contrario, no podrá realizarse una investigación útil.
  • Pinterest no es adecuado para noticias de última hora; la próxima vez conviene limitarlo al análisis de tendencias visuales.
  • Clasificar los casos que se autodenominan «pesos abiertos» pero en realidad emplean licencias cerradas o híbridas (FLUX 3, MiniMax H3) únicamente después de comprobar la redacción de la licencia en cada caso.
  • Añadir revisiones periódicas de Lemmy, ya que las noticias legales o polémicas, como la retirada de Sora o la demanda contra Grok, tienden a ofrecer antes ejemplos concretos.

Imágenes recopiladas

Contenido de IA y preocupaciones sobre redes sociales🎨 Creación de imágenes y vídeo con IAGoogle anuncia vídeo de calidad ultrarralta...Concepto de creación de contenido con IA con iconos para generación de texto, imagen, música y vídeo; imágenes de inteligencia artificial — Explora 57 fotos de archivo, vectores y vídeosGoogle presenta Veo 2: herramienta avanzada de generación de vídeo con IA, con mayor realismo y funciones cinematográficasSolo hazlo 🎥imagenNoticias de IA: OpenAI finalmente lanzó lo que pedimosVeo 3 de imagen a vídeo: generación rápida y audio nativo mediante la API GeminiLos mejores generadores de vídeo con IA de 2025imagen‎🚨 La IA está dando miedo de lo buena que es.GPT 5.2, editor de vídeo en tiempo real, vídeos estéreo de IA, agentes de IA móviles, control corporal completo: NOTICIAS DE IAMás del 20 % de YouTube ya está generado por IAAnálisis de imágenes y vídeo impulsado por IAIA para generación de imágenes y vídeoimagenMicrosoft presenta VASA-1, estableciendo nuevos estándares para la IA generativa en la generación de vídeoVídeos generados por IA: ¿buenos o malos? ¡Esta es la verdad! 🤖🎥Dominar el vídeo y la IA: tendencias clave de marketing en redes sociales para 2025Cómo la IA está transformando la edición de vídeoQué es Imagvio AI y cómo ayuda a los creadores...imagenherramientas de IAShengShu Technology presenta Vidu S1, aportando generación interactiva en tiempo real al vídeo de IANoticias de IA de esta semana - 15 de agosto de 2026Transforma tus ideas en imágenes impresionantes 🎥15 grandes actualizaciones de IA que debes conocer | Últimas noticias y tendencias de IAhistoria de la IA generativaNoticias y últimas actualizaciones de IA | Tendencias y avances en inteligencia artificial"Transforma tu visión con vídeos 4K personalizados impulsados por IA 🎥✨"Principales novedades de IA de esta semana - Estudio de Google sobre 15 millones de chats«Amuse 3.0», una herramienta de creación de arte con IA que incluye...Nuevas herramientas de IA de Nvidia 🤯 #noticias #ia #openai #chatgpt #destacados #shortsHaré un vídeo explicativo de creación de vídeo con IA con synthesia sora ai kling ai runway ai invideoIAGoogle anuncia IA de generación de vídeo «Veo 3»,..."Por qué los chatbots de IA no logran mantenerse al día con las noticias de última hora"Creación profesional de vídeo con IA | Vídeos cinematográficos de IA | Edición de vídeo personalizada🚀10 mejores herramientas de imagen y vídeo con IA en 2026 | Comparativa de herramientas de IA gratuitas y de pagoGeneración de imágenes con IAGeneración de vídeo 📹imagenImágenes de actualidad con mapas nacionales y mundialesCómo generar una foto | Cómo generar una imagen, cómo generar fotos, generador Generac de 22 kWCómo crear un canal de noticias con IA || Generador de vídeos de noticias con IA || Sincronización labial con IADeja de desplazarte… esta historia cambiará por completo cómo ves la IACrecimiento del mercado de generadores de vídeo con IA 2025–2032: transformando el futuro de la creación de vídeo 🎥🤖Ecosistema de IA interconectadoimagen

Nota sobre la calidad de los datos

Reddit tuvo cero publicaciones por el bloqueo de acceso; debido al bloqueo de la API de búsqueda, Bluesky solo permitió recuperar publicaciones antiguas de 2024–2025 y no mencionó ni uno de los modelos principales de 2026. Pinterest casi no aportó hallazgos sobre código abierto, por lo que X, YouTube y Lemmy fueron las tres fuentes principales entre las seis plataformas.

Galería