← Wszystkie aktualności
ARTYKUŁ
Plotki
1 października 2026 3 min czytania

Qwen 3.8 27B: na r/LocalLLaMA niektórzy przestali płacić za API

Model open weight z 27 miliardami parametrów działa na jednej karcie GPU i, zdaniem użytkowników, wystarcza do codziennej pracy. Oto co jest potwierdzone, a co stanowi jedynie osobiste doświadczenie.

W tym artykule
  1. Co jest potwierdzone
  2. Co się mówi
  3. Dlaczego to ważne

Najczęściej dyskutowany post ostatnich dni na r/LocalLLaMA ma tytuł, który brzmi jak prowokacja: «Qwen-3.8-27B is good enough that I stopped using API» (w praktyce: model jest wystarczająco dobry, by zastąpić płatne API). To nie jest benchmark ani ogłoszenie, lecz relacja użytkownika, która porusza pytanie zadawane przez wiele MŚP od miesięcy: czy model działający w biurze może wykonać pracę usługi cloud?

Ilustracja wieży komputerowej z kartą graficzną podłączoną kablem do małej płytki elektronicznej na półce
Zdjęcie:

Co jest potwierdzone

Qwen3.8-27B to model zespołu Qwen z Alibaba, opublikowany w połowie sierpnia 2026 roku z otwartymi wagami na Hugging Face, na licencji Apache 2.0: może być używany również do celów komercyjnych. Jest to gęsty model z 27 miliardami parametrów, bez architektury mixture-of-experts, z 64 warstwami, które naprzemiennie wykorzystują Gated DeltaNet i klasyczną uwagę, enkoderem obrazów i natywnym kontekstem 262 144 tokenów, rozszerzalnym do miliona.

W karcie modelu Qwen deklaruje, między innymi, 61,7 na SWE-bench Pro i 73,0 na Terminal Bench 2.1. Są to dane producenta, a nie niezależne pomiary. Do użytku produkcyjnego Qwen zaleca silniki takie jak vLLM lub SGLang; do testów lokalnych istnieją skwantyzowane wersje dla llama.cpp, Ollama i LM Studio. W bibliotece Ollama skwantyzowana wersja 27B zajmuje 18 GB.

Plotka

Co się mówi

Autor wątku opowiada, że używa kwantyzacji Q4_K_S z pamięcią podręczną kontekstu Q8_0, w agencie programistycznym Pi, z kilkoma narzędziami (shell, odczyt, zapis, modyfikacja plików) i Dockerem jako sandboxem. Według niego model «bardzo dużo myśli» i obserwowanie jego pracy jest frustrujące, ale pozostawiony sam sobie kończy złożone refaktoryzacje, podejmując rozsądne decyzje. Słabym punktem, pisze, jest narzędzie do modyfikacji plików: model często musi ponawiać próbę, ponieważ popełnia błędy w wcięciach.

Jeśli chodzi o koszty, użytkownik szacuje, że przy jego sprzęcie i taryfie elektrycznej milion tokenów kosztuje go około 2,4 centa za wejście i 70 centów za wyjście, co uważa za porównywalne z najtańszymi dostawcami API. Jest to osobista, niemożliwa do zweryfikowania kalkulacja, która nie obejmuje ceny maszyny.

Wśród odpowiedzi, inny użytkownik z kartą GPU 16 GB mówi, że używa kwantyzacji IQ4_XS z technikami wydłużającymi kontekst poza 160 000 tokenów i uważa go za swój jedyny model do rozwoju, bezpieczeństwa i administracji IT. Na tym samym subreddicie krążą porównania między oficjalnym modelem a szybszymi wariantami społeczności; autor wątku donosi, że jeden z nich, w jego teście, częściej wpadał w pętlę.

Dlaczego to ważne

Dla MŚP lub MSP wiadomość nie polega na tym, że lokalny model bije najlepsze usługi cloud: nikt tego nie twierdzi, nawet w wątku. Chodzi o to, że próg «wystarczająco dobrego» dla powtarzalnych zadań, takich jak skrypty, małe refaktoryzacje i automatyzacje administracyjne, jest dziś osiągalny za pomocą jednej karty GPU 24 GB, lub z 16 GB, akceptując pewne kompromisy.

  • Dane: kod i dokumenty nie opuszczają Twojej sieci, co upraszcza kwestie RODO z klientami.
  • Koszty: płacisz za sprzęt i energię zamiast za tokeny; opłacalne, jeśli użycie jest stałe, mniej, jeśli sporadyczne.
  • Ograniczenia: model długo myśli, więc jest wolny w zadaniach interaktywnych; musi być umieszczony w sandboxie, a jego zmiany muszą być weryfikowane, jak w przypadku każdego agenta.

Pierwszym realistycznym krokiem jest zainstalowanie Ollamy na stacji roboczej z GPU, uruchomienie ollama run qwen3.8 i powierzenie mu prawdziwego, ale niskiego ryzyka zadania, na przykład skryptu konserwacji w repozytorium testowym. Jeśli chcesz zrozumieć, jaka mieszanka modeli lokalnych i cloud ma sens dla Twojej firmy, znajdziesz nasze podejście na stronie usług sztucznej inteligencji.

Źródła: karta Qwen3.8-27B na Hugging Face, wątek na r/LocalLLaMA, biblioteka Ollama, qwen3.8.