← Todas las noticias
ARTÍCULO
Rumores
30 de septiembre de 2026 3 min de lectura

Qwen 3.8 27B: en r/LocalLLaMA hay quien ha dejado de pagar las API

Un modelo open weight de 27 mil millones de parámetros funciona en una sola GPU y, según sus usuarios, es suficiente para el trabajo diario. Esto es lo que está verificado y lo que es solo experiencia personal.

En este artículo
  1. Qué está confirmado
  2. Qué se dice
  3. Por qué te interesa

La publicación más discutida estos días en r/LocalLLaMA tiene un título que parece una provocación: «Qwen-3.8-27B is good enough that I stopped using API» (en la práctica: el modelo es lo suficientemente bueno como para haber sustituido las API de pago). No es un benchmark ni un anuncio, es el relato de un usuario, pero aborda la pregunta que muchas PYMES se hacen desde hace meses: ¿puede un modelo que funciona en la oficina hacer el trabajo de un servicio cloud?

Ilustración de una torre de ordenador con tarjeta gráfica conectada por cable a una pequeña placa electrónica en una estantería
Foto:

Qué está confirmado

Qwen3.8-27B es un modelo del equipo Qwen de Alibaba publicado a mediados de agosto de 2026 con pesos abiertos en Hugging Face, bajo licencia Apache 2.0: se puede usar también con fines comerciales. Es un modelo denso de 27 mil millones de parámetros, sin arquitectura mixture-of-experts, con 64 capas que alternan Gated DeltaNet y atención clásica, un encoder para imágenes y un contexto nativo de 262.144 tokens, extensible hasta un millón.

En la ficha del modelo, Qwen declara, entre otros, 61,7 en SWE-bench Pro y 73,0 en Terminal Bench 2.1. Son cifras del fabricante, no mediciones independientes. Para el uso en producción, Qwen recomienda motores como vLLM o SGLang; para la prueba en local existen versiones cuantificadas para llama.cpp, Ollama y LM Studio. En la librería de Ollama, la versión 27B cuantificada ocupa 18 GB.

Rumor

Qué se dice

El autor del thread cuenta que usa la cuantificación Q4_K_S con la caché de contexto a Q8_0, dentro del agente de programación Pi, con pocas herramientas (shell, lectura, escritura, modificación de archivos) y Docker como sandbox. Según él, el modelo «piensa muchísimo» y verlo trabajar es frustrante, pero si se le deja solo, lleva a cabo refactorizaciones complejas tomando decisiones sensatas. El punto débil, escribe, es la herramienta de modificación de archivos: el modelo a menudo tiene que reintentar porque se equivoca en la indentación.

Sobre los costes, el usuario estima que con su hardware y su tarifa eléctrica, un millón de tokens le cuesta aproximadamente 2,4 céntimos de entrada y 70 céntimos de salida, cifras que considera comparables a los proveedores de API más económicos. Es un cálculo personal, no verificable, que no incluye el precio de la máquina.

Entre las respuestas, otro usuario con una GPU de 16 GB dice usar una cuantificación IQ4_XS con técnicas para alargar el contexto más allá de los 160.000 tokens y considerarlo ya su único modelo para desarrollo, seguridad y administración IT. En el mismo subreddit circulan comparaciones entre el modelo oficial y variantes de la comunidad más rápidas; el autor del thread informa que una de estas, en su prueba, terminaba más a menudo en bucle.

Por qué te interesa

Para una PYME o un MSP, la noticia no es que un modelo local supere a los mejores servicios cloud: nadie lo dice, ni siquiera el thread. Es que el umbral de «suficientemente bueno» para tareas repetitivas, como scripts, pequeñas refactorizaciones y automatizaciones de administración, hoy se alcanza con una sola GPU de 24 GB, o con 16 GB aceptando algunos compromisos.

  • Datos: el código y los documentos no salen de tu red, y esto simplifica la conversación sobre el GDPR con los clientes.
  • Costes: pagas hardware y energía en lugar de tokens; conviene si el uso es constante, menos si es ocasional.
  • Límites: el modelo razona durante mucho tiempo, por lo que es lento en tareas interactivas; debe colocarse en una sandbox y sus modificaciones deben revisarse, como las de cualquier agente.

Un primer paso realista es instalar Ollama en una workstation con GPU, ejecutar ollama run qwen3.8 y asignarle una tarea real pero de bajo riesgo, por ejemplo, un script de mantenimiento en un repositorio de prueba. Si quieres entender qué combinación de modelos locales y cloud tiene sentido para tu empresa, encontrarás nuestro enfoque en la página de servicios de inteligencia artificial.

Fuentes: ficha de Qwen3.8-27B en Hugging Face, thread en r/LocalLLaMA, librería Ollama, qwen3.8.