← Toate știrile
ARTICOL
Zvonuri
30 septembrie 2026 3 min de citit

Qwen 3.8 27B: pe r/LocalLLaMA, unii au renunțat să mai plătească API-urile

Un model open weight de 27 de miliarde de parametri rulează pe un singur GPU și, conform utilizatorilor, este suficient pentru munca de zi cu zi. Iată ce este verificat și ce este doar experiență personală.

În acest articol
  1. Ce este confirmat
  2. Ce se spune
  3. De ce contează pentru tine

Cea mai discutată postare din aceste zile pe r/LocalLLaMA are un titlu care sună ca o provocare: «Qwen-3.8-27B is good enough that I stopped using API» (în practică: modelul este suficient de bun încât am renunțat la API-urile plătite). Nu este un benchmark și nici un anunț, este povestea unui utilizator, dar atinge întrebarea pe care multe IMM-uri și-o pun de luni de zile: un model care rulează la birou poate face treaba unui serviciu cloud?

Ilustrație cu un computer tower cu placă grafică conectat prin cablu la o mică placă electronică pe un raft
Foto:

Ce este confirmat

Qwen3.8-27B este un model al echipei Qwen de la Alibaba, publicat la mijlocul lunii august 2026, cu ponderi deschise pe Hugging Face, sub licență Apache 2.0: poate fi folosit și în scopuri comerciale. Este un model dens de 27 de miliarde de parametri, fără arhitectură mixture-of-experts, cu 64 de straturi care alternează Gated DeltaNet și atenția clasică, un encoder pentru imagini și un context nativ de 262.144 token-uri, extensibil până la un milion.

În fișa modelului, Qwen declară, printre altele, 61,7 pe SWE-bench Pro și 73,0 pe Terminal Bench 2.1. Acestea sunt cifre ale producătorului, nu măsurători independente. Pentru utilizarea în producție, Qwen recomandă motoare precum vLLM sau SGLang; pentru testarea locală există versiuni cuantificate pentru llama.cpp, Ollama și LM Studio. În biblioteca Ollama, versiunea 27B cuantificată ocupă 18 GB.

Zvon

Ce se spune

Autorul thread-ului povestește că folosește cuantificarea Q4_K_S cu cache-ul de context la Q8_0, în cadrul agentului de programare Pi, cu puține instrumente (shell, citire, scriere, modificare de fișiere) și Docker ca sandbox. Potrivit lui, modelul «gândește foarte mult» și este frustrant să-l privești lucrând, dar lăsat singur, duce la bun sfârșit refactorizări complexe, luând decizii sensate. Punctul slab, scrie el, este instrumentul de modificare a fișierelor: modelul trebuie adesea să reîncerce pentru că greșește indentarea.

În ceea ce privește costurile, utilizatorul estimează că, cu hardware-ul său și tariful său electric, un milion de token-uri îl costă aproximativ 2,4 cenți la intrare și 70 de cenți la ieșire, cifre pe care le consideră comparabile cu cele ale celor mai ieftini furnizori de API. Este un calcul personal, neverificabil, care nu include prețul mașinii.

Printre răspunsuri, un alt utilizator cu un GPU de 16 GB spune că folosește o cuantificare IQ4_XS cu tehnici pentru a extinde contextul dincolo de 160.000 de token-uri și că îl consideră acum singurul său model pentru dezvoltare, securitate și administrare IT. Pe același subreddit circulă comparații între modelul oficial și variantele mai rapide ale comunității; autorul thread-ului raportează că una dintre acestea, în testul său, intra mai des în buclă.

De ce contează pentru tine

Pentru un IMM sau un MSP, vestea nu este că un model local învinge cele mai bune servicii cloud: nimeni nu spune asta, nici măcar thread-ul. Este că pragul de «suficient de bun» pentru sarcini repetitive, cum ar fi scripturi, mici refactorizări și automatizări de administrare, este atins astăzi cu un singur GPU de 24 GB, sau cu 16 GB acceptând anumite compromisuri.

  • Date: codul și documentele nu părăsesc rețeaua ta, iar acest lucru simplifică discuția GDPR cu clienții.
  • Costuri: plătești hardware și energie în loc de token-uri; este avantajos dacă utilizarea este constantă, mai puțin dacă este ocazională.
  • Limite: modelul gândește mult timp, deci este lent la sarcinile interactive; trebuie plasat într-un sandbox și modificările sale trebuie revizuite, la fel ca cele ale oricărui agent.

Un prim pas realist este să instalezi Ollama pe o stație de lucru cu GPU, să lansezi ollama run qwen3.8 și să-i dai o sarcină reală, dar cu risc scăzut, de exemplu un script de întreținere pe un repository de test. Dacă vrei să înțelegi ce combinație între modele locale și cloud are sens pentru compania ta, vei găsi abordarea noastră pe pagina de servicii de inteligență artificială.

Surse: fișa Qwen3.8-27B pe Hugging Face, thread pe r/LocalLLaMA, biblioteca Ollama, qwen3.8.