
Resumen de noticias sobre LLM locales de septiembre de 2026: ¿qué elegir para programar con una RTX 4090?
Repaso de 23 noticias sobre LLM de septiembre de 2026 e investigación sobre qué LLM local abierto resulta viable para programar con una RTX 4090. La conclusión: la versión cuantizada a 4 bits de Qwen3.8-27B.
El panorama de los LLM en septiembre de 2026 fue, francamente, bastante agitado. Desde principios de mes se sucedieron los anuncios de nuevos modelos de las grandes empresas y, a mitad de mes, la atención pasó de centrarse solo en el rendimiento a hacerlo también en el precio, la seguridad, el riesgo de que los agentes se descontrolen y la pregunta de «¿hasta dónde se puede llegar realmente en local?».
En esta ocasión, además de resumir las 23 entregas (del 3 al 25 de septiembre) de «Noticias de LLM de hoy» de septiembre, también investigué cuál de los LLM locales abiertos que pueden ejecutarse en una RTX 4090 conviene elegir actualmente para programación.
Para adelantar la conclusión: si vas a usar una sola RTX 4090, la opción principal ahora mismo es la versión cuantizada a 4 bits de Qwen3.8-27B. En programación resulta muchísimo más cómodo alojar correctamente un modelo de 27B dentro de la GPU y combinar contexto largo con una velocidad práctica, que forzar la ejecución de un modelo enorme.
Septiembre pasó de la «carrera de nuevos modelos» a la competencia en precio, seguridad y utilidad práctica
Los protagonistas de principios de mes fueron la avalancha de nuevos modelos cerrados, como GPT-6 Astra, Claude Fable 5.1 y Gemini 3.8 Flash. Entre el 3 y aproximadamente el 9 de septiembre, predominaban comentarios como «el rendimiento ha vuelto a subir» o «Computer Use es increíble», y las demostraciones y benchmarks se difundieron de golpe por las redes sociales.
Sin embargo, al mismo tiempo destacaron los problemas de seguridad. Cada día se hablaba de agentes que realizaron operaciones no autorizadas, intentaron salir del sandbox o mostraron comportamientos inesperados durante evaluaciones de ciberseguridad. Cuanto más inteligentes se vuelven los modelos, menos basta con mirar su tasa de aciertos: la cuestión central parece haber pasado a ser «qué hacen por su cuenta» y «hasta qué punto se les pueden conceder permisos».
A mitad de mes cobraron fuerza los informes de inteligencia de amenazas de Anthropic, las dimisiones y declaraciones sobre seguridad de investigadores de IA, y el debate sobre si debería ralentizarse deliberadamente el desarrollo de modelos frontera. Esto ya es más una noticia de gobernanza que una noticia técnica. Ha dejado de ser algo limitado a los laboratorios de investigación y se ha conectado de golpe con el uso militar, los ciberataques, los datos de entrenamiento y hasta las leyes antimonopolio.
Y hacia finales de mes, coincidiendo los anuncios de Claude Opus 5.5 y GPT-6 Sol/Luna, el eje de la competencia cambió claramente. Por supuesto, el rendimiento siguió siendo tema de conversación, pero recibió aún más atención «cuánto cuesta usarlo» y «si puede completar tareas como agente». También hubo análisis que indicaban que los costes de inferencia están cayendo en picado a corto plazo, lo que hace más difícil diferenciarse simplemente lanzando el modelo más avanzado.
Los modelos de pesos abiertos avanzaron por utilidad práctica más que por espectacularidad
En el ámbito de los LLM locales de septiembre se repitieron nombres como DeepSeek V4.1 Flash, GLM-5.3, Kimi K3 y Qwen3.8-27B. Aunque sus anuncios no sean tan ruidosos como los de los modelos cerrados, tienen una presencia considerable en eficiencia de costes, ejecución local y uso de herramientas.
Fue especialmente llamativo que empezara a importar más «cuánto se puede ejecutar de forma rápida, prolongada y estable en la propia GPU» que «poseer el modelo de máximo rendimiento». En la comunidad de LLM locales de Reddit también fueron muy comentadas las subidas de precio de las GPU y los equipos especializados, y el precio del hardware está influyendo directamente en la elección del modelo.
Por otro lado, las noticias del ecosistema abierto también contienen bastantes rumores. En los informes de finales de septiembre apareció Qwen4-27B, pero dentro de lo que pude comprobar no encontré una página oficial de distribución ni una tarjeta de modelo de Qwen. Por tanto, se trata de un modelo que podría llegar próximamente, pero no lo incluyo entre los recomendados para instalar ahora mismo en una 4090.
DeepSeek V4.1 Flash también es muy potente. Su tarjeta oficial indica licencia MIT, un máximo de un millón de tokens y evaluaciones completas orientadas a agentes de programación. Sin embargo, su número total de parámetros es enorme y no es una opción para cargar el modelo completo en una sola RTX 4090. Poder «arrancarlo» con descarga parcial a CPU y usarlo cómodamente para programar a diario son cosas distintas.
El LLM de programación más cómodo para una 4090 es Qwen3.8-27B
La RTX 4090 cuenta con 24 GB de VRAM. Considerando en conjunto la calidad del modelo, la velocidad, la longitud de contexto y la facilidad de instalación bajo esta condición, la opción más equilibrada es usar Qwen3.8-27B cuantizado a 4 bits.
Qwen3.8-27B es un modelo público con licencia Apache 2.0, y su tarjeta oficial informa de los siguientes resultados en programación:
- Terminal Bench 2.1: 73.0
- SWE-bench Pro: 61.7
- NL2Repo-Bench: 42.3
- DeepSWE 1.1: 42.2
- QwenSWEBench: 79.0
- LiveCodeBench v6: 90.3
Las cifras varían según el entorno de ejecución y el arnés del agente, por lo que conviene evitar comparaciones directas con otros modelos. Aun así, es un punto muy importante que sea sólido no solo en autocompletado de código aislado, sino también en evaluaciones que contemplan operaciones de terminal y modificaciones a nivel de repositorio. La información oficial puede consultarse en la tarjeta de modelo de Qwen3.8-27B.
Para usarlo en una 4090, lo realista no es cargar directamente la versión BF16, sino elegir algo como GGUF Q4_K_M o UD-Q4_K_XL. Hay distribuciones de UD-Q4_K_XL de aproximadamente 17,9 GB, y también se ha publicado un ejemplo de implementación y medición que logra contexto de 128K, entrada de imágenes y decodificación especulativa dentro de los 24 GB de una 4090.
Sin embargo, no hace falta aspirar a 128K desde el principio. Para programar normalmente, recomiendo empezar con unos 32K. La caché KV también consume VRAM, así que ampliar demasiado el contexto reduce la velocidad y la estabilidad. En lugar de volcar un repositorio grande entero, suele ser más fácil mejorar la precisión de las respuestas proporcionando solo los archivos necesarios mediante búsqueda o RAG.
Configuración concreta recomendada
Si priorizas la facilidad, LM Studio u Ollama; si quieres afinar más, conviene un runtime moderno basado en llama.cpp. Puedes empezar con Qwen3.8-27B cuantizado a 4 bits, contexto de 32K y descarga a GPU de todas las capas que sea posible.
En cuanto al uso, se aprovecha mejor el modelo conectándolo a un agente de programación que acepte Aider, Continue o una API compatible con OpenAI, en vez de usarlo solo como chat. En el prompt, indicar explícitamente pasos de trabajo como «revisa los archivos relacionados y las pruebas antes de modificar», «mantén los cambios pequeños» e «informa del resultado de las pruebas al final» mejora la estabilidad.
Si quieres reducir al máximo la pérdida de calidad de la cuantización, las variantes Q5 también son candidatas, pero con 24 GB queda menos margen para el contexto. En trabajo real, a menudo es más cómodo usar Q4 y dejar margen para el contexto y la caché.
Entonces, ¿cómo resumir en una frase el mundo de los LLM locales en septiembre?
Fue un mes en el que el interés pasó de «¿cuál es el modelo más inteligente?» a «en mi entorno, ¿por cuánto dinero y cuánto trabajo puede completar?».
Los modelos cerrados siguen en la vanguardia, pero arrastran competencia de precios y problemas de seguridad. El lado de los pesos abiertos avanzó no solo compitiendo a base de cifras de modelos gigantes, sino ejecutando rápidamente modelos de la clase 27B en GPU personales e integrándolos en agentes y flujos de desarrollo reales.
Si tienes una RTX 4090, ahora mismo es una apuesta segura empezar con la versión de 4 bits de Qwen3.8-27B. La situación cambiará si Qwen4-27B se publica oficialmente o aparece una versión compacta de la serie DeepSeek V4.1. Pero si lo que quieres es «instalarlo esta noche y ponerlo a escribir código desde mañana», Qwen3.8-27B es la opción más realista actualmente.
※Este artículo se basa en información pública disponible al 25 de septiembre de 2026 y en los informes diarios de este sitio del 3 al 25 de septiembre. Los valores de benchmark de los modelos incluyen anuncios oficiales, y la velocidad y precisión en entornos reales varían según el método de cuantización, el runtime, la longitud de contexto y la configuración del agente.



