Indispensabili per il funzionamento del sito (login, preferenze, sicurezza). Sempre attivi.
Qwen 3.8 27B: su r/LocalLLaMA c'è chi ha smesso di pagare le API
Un modello open weight da 27 miliardi di parametri gira su una sola GPU e, secondo chi lo usa, basta per il lavoro di tutti i giorni. Ecco cosa è verificato e cosa è solo esperienza personale.
In questo articolo
Il post più discusso di questi giorni su r/LocalLLaMA ha un titolo che sembra una provocazione: «Qwen-3.8-27B is good enough that I stopped using API» (in pratica: il modello è abbastanza buono da aver sostituito le API a pagamento). Non è un benchmark né un annuncio, è il racconto di un utente, ma tocca la domanda che molte PMI si fanno da mesi: un modello che gira in ufficio può fare il lavoro di un servizio cloud?

Cosa è confermato
Qwen3.8-27B è un modello del team Qwen di Alibaba pubblicato a metà agosto 2026 con pesi aperti su Hugging Face, sotto licenza Apache 2.0: si può usare anche a fini commerciali. È un modello denso da 27 miliardi di parametri, senza architettura mixture-of-experts, con 64 layer che alternano Gated DeltaNet e attenzione classica, un encoder per le immagini e un contesto nativo di 262.144 token, estendibile fino a un milione.
Nella scheda del modello Qwen dichiara, fra gli altri, 61,7 su SWE-bench Pro e 73,0 su Terminal Bench 2.1. Sono numeri del produttore, non misure indipendenti. Per l'uso in produzione Qwen consiglia motori come vLLM o SGLang; per la prova in locale esistono versioni quantizzate per llama.cpp, Ollama e LM Studio. Nella libreria di Ollama la versione 27B quantizzata occupa 18 GB.
Cosa si dice
L'autore del thread racconta di usare la quantizzazione Q4_K_S con la cache del contesto a Q8_0, dentro l'agente di programmazione Pi, con pochi strumenti (shell, lettura, scrittura, modifica di file) e Docker come sandbox. Secondo lui il modello «pensa moltissimo» e guardarlo lavorare è frustrante, ma lasciato da solo porta a termine refactoring complessi prendendo decisioni sensate. Il punto debole, scrive, è lo strumento di modifica dei file: il modello deve spesso ritentare perché sbaglia l'indentazione.
Sui costi, l'utente stima che con il suo hardware e la sua tariffa elettrica un milione di token gli costi circa 2,4 centesimi in ingresso e 70 centesimi in uscita, cifre che ritiene paragonabili ai fornitori di API più economici. È un calcolo personale, non verificabile, che non include il prezzo della macchina.
Fra le risposte, un altro utente con una GPU da 16 GB dice di usare una quantizzazione IQ4_XS con tecniche per allungare il contesto oltre i 160.000 token e di considerarlo ormai il suo unico modello per sviluppo, sicurezza e amministrazione IT. Nello stesso subreddit girano confronti fra il modello ufficiale e varianti della community più veloci; l'autore del thread riferisce che una di queste, nella sua prova, finiva più spesso in loop.
Perché ti interessa
Per una PMI o un MSP la notizia non è che un modello locale batte i migliori servizi cloud: non lo dice nessuno, nemmeno il thread. È che la soglia del «abbastanza buono» per compiti ripetitivi, come script, piccoli refactoring e automazioni di amministrazione, oggi si raggiunge con una sola GPU da 24 GB, o con 16 GB accettando qualche compromesso.
- Dati: codice e documenti non escono dalla tua rete, e questo semplifica il discorso GDPR con i clienti.
- Costi: paghi hardware ed energia invece di token; conviene se l'uso è costante, meno se è saltuario.
- Limiti: il modello ragiona a lungo, quindi è lento sui compiti interattivi; va messo in una sandbox e le sue modifiche vanno riviste, come quelle di qualunque agente.
Un primo passo realistico è installare Ollama su una workstation con GPU, lanciare ollama run qwen3.8 e dargli un compito vero ma a basso rischio, per esempio uno script di manutenzione su un repository di prova. Se vuoi capire quale mix fra modelli locali e cloud ha senso per la tua azienda, trovi il nostro approccio nella pagina dei servizi di intelligenza artificiale.
Fonti: scheda di Qwen3.8-27B su Hugging Face, thread su r/LocalLLaMA, libreria Ollama, qwen3.8.