← Todas as notícias
ARTIGO
Rumores
30 de setembro de 2026 3 min de leitura

Qwen 3.8 27B: no r/LocalLLaMA, há quem tenha parado de pagar APIs

Um modelo open-weight de 27 mil milhões de parâmetros corre numa única GPU e, segundo os utilizadores, é suficiente para o trabalho diário. Veja o que está verificado e o que é apenas experiência pessoal.

Neste artigo
  1. O que está confirmado
  2. O que se diz
  3. Porque é importante

O post mais discutido nestes dias no r/LocalLLaMA tem um título que parece uma provocação: «Qwen-3.8-27B is good enough that I stopped using API» (na prática: o modelo é bom o suficiente para ter substituído as APIs pagas). Não é um benchmark nem um anúncio, é o relato de um utilizador, mas aborda a questão que muitas PME se colocam há meses: um modelo que corre no escritório pode fazer o trabalho de um serviço cloud?

Ilustração de uma torre de computador com placa gráfica ligada por cabo a uma pequena placa eletrónica numa prateleira
Foto:

O que está confirmado

Qwen3.8-27B é um modelo da equipa Qwen da Alibaba, publicado em meados de agosto de 2026 com pesos abertos no Hugging Face, sob licença Apache 2.0: pode ser usado também para fins comerciais. É um modelo denso de 27 mil milhões de parâmetros, sem arquitetura mixture-of-experts, com 64 layers que alternam Gated DeltaNet e atenção clássica, um encoder para imagens e um contexto nativo de 262.144 token, extensível até um milhão.

Na ficha do modelo, a Qwen declara, entre outros, 61,7 no SWE-bench Pro e 73,0 no Terminal Bench 2.1. São números do fabricante, não medições independentes. Para uso em produção, a Qwen recomenda motores como vLLM ou SGLang; para testes locais, existem versões quantizadas para llama.cpp, Ollama e LM Studio. Na biblioteca do Ollama, a versão 27B quantizada ocupa 18 GB.

Rumor

O que se diz

O autor do thread relata que usa a quantização Q4_K_S com a cache de contexto em Q8_0, dentro do agente de programação Pi, com poucas ferramentas (shell, leitura, escrita, modificação de ficheiros) e Docker como sandbox. Segundo ele, o modelo «pensa muito» e vê-lo trabalhar é frustrante, mas, deixado sozinho, completa refactoring complexos tomando decisões sensatas. O ponto fraco, escreve, é a ferramenta de modificação de ficheiros: o modelo tem frequentemente de tentar novamente porque erra na indentação.

Quanto aos custos, o utilizador estima que, com o seu hardware e a sua tarifa elétrica, um milhão de token lhe custe cerca de 2,4 cêntimos na entrada e 70 cêntimos na saída, valores que considera comparáveis aos fornecedores de API mais económicos. É um cálculo pessoal, não verificável, que não inclui o preço da máquina.

Entre as respostas, outro utilizador com uma GPU de 16 GB diz usar uma quantização IQ4_XS com técnicas para estender o contexto para além dos 160.000 token e considera-o agora o seu único modelo para desenvolvimento, segurança e administração de TI. No mesmo subreddit circulam comparações entre o modelo oficial e variantes da comunidade mais rápidas; o autor do thread refere que uma destas, no seu teste, entrava mais frequentemente em loop.

Porque é importante

Para uma PME ou um MSP, a notícia não é que um modelo local supera os melhores serviços cloud: ninguém o diz, nem mesmo o thread. É que o limiar do «suficientemente bom» para tarefas repetitivas, como scripts, pequenos refactoring e automações de administração, é hoje alcançado com uma única GPU de 24 GB, ou com 16 GB aceitando alguns compromissos.

  • Dados: código e documentos não saem da sua rede, o que simplifica a discussão do GDPR com os clientes.
  • Custos: paga hardware e energia em vez de token; compensa se o uso for constante, menos se for ocasional.
  • Limites: o modelo raciocina por muito tempo, por isso é lento em tarefas interativas; deve ser colocado numa sandbox e as suas modificações devem ser revistas, como as de qualquer agente.

Um primeiro passo realista é instalar o Ollama numa workstation com GPU, executar ollama run qwen3.8 e dar-lhe uma tarefa real, mas de baixo risco, por exemplo, um script de manutenção num repositório de teste. Se quiser entender qual a combinação de modelos locais e cloud que faz sentido para a sua empresa, encontrará a nossa abordagem na página dos serviços de inteligência artificial.

Fontes: ficha de Qwen3.8-27B no Hugging Face, thread no r/LocalLLaMA, biblioteca Ollama, qwen3.8.