← Alla nyheter
ARTIKEL
Rykten
30 september 2026 3 min läsning

Qwen 3.8 27B: på r/LocalLLaMA har vissa slutat betala för API:er

En open weight-modell med 27 miljarder parametrar körs på en enda GPU och, enligt användare, räcker den för vardagliga uppgifter. Här är vad som är bekräftat och vad som bara är personlig erfarenhet.

I den här artikeln
  1. Vad som är bekräftat
  2. Vad som sägs
  3. Varför det spelar roll

Det mest diskuterade inlägget på r/LocalLLaMA just nu har en titel som låter som en provokation: «Qwen-3.8-27B is good enough that I stopped using API» (i praktiken: modellen är tillräckligt bra för att ha ersatt betalda API:er). Det är varken ett benchmark eller ett tillkännagivande, utan en användares berättelse, men den berör frågan som många små och medelstora företag har ställt sig i månader: kan en modell som körs lokalt utföra arbetet som en molntjänst?

Illustration av ett datorchassi med grafikkort anslutet via kabel till ett litet elektronikkort på en hylla
Foto:

Vad som är bekräftat

Qwen3.8-27B är en modell från Qwen-teamet på Alibaba, publicerad i mitten av augusti 2026 med öppna vikter på Hugging Face, under licensen Apache 2.0: den kan även användas för kommersiella ändamål. Det är en tät modell med 27 miljarder parametrar, utan mixture-of-experts-arkitektur, med 64 lager som alternerar Gated DeltaNet och klassisk uppmärksamhet, en bildkodare och en nativ kontext på 262 144 token, utbyggbar upp till en miljon.

På modellens datablad anger Qwen, bland annat, 61,7 på SWE-bench Pro och 73,0 på Terminal Bench 2.1. Dessa är tillverkarens siffror, inte oberoende mätningar. För produktionsanvändning rekommenderar Qwen motorer som vLLM eller SGLang; för lokal testning finns kvantiserade versioner för llama.cpp, Ollama och LM Studio. I Ollamas bibliotek upptar den kvantiserade 27B-versionen 18 GB.

Rykte

Vad som sägs

Trådens författare berättar att han använder kvantiseringen Q4_K_S med kontextcachen vid Q8_0, inom programmeringsagenten Pi, med få verktyg (shell, läsning, skrivning, filredigering) och Docker som sandbox. Enligt honom «tänker modellen väldigt mycket» och att se den arbeta är frustrerande, men om den lämnas ensam utför den komplexa refaktoreringar genom att fatta förnuftiga beslut. Den svaga punkten, skriver han, är filredigeringsverktyget: modellen måste ofta försöka igen eftersom den gör fel med indragningen.

När det gäller kostnader uppskattar användaren att med hans hårdvara och elpris kostar en miljon token honom cirka 2,4 cent vid inmatning och 70 cent vid utmatning, siffror som han anser vara jämförbara med de billigaste API-leverantörerna. Det är en personlig, icke-verifierbar beräkning som inte inkluderar maskinens pris.

Bland svaren säger en annan användare med en 16 GB GPU att han använder en IQ4_XS-kvantisering med tekniker för att förlänga kontexten bortom 160 000 token och att han nu anser den vara sin enda modell för utveckling, säkerhet och IT-administration. I samma subreddit cirkulerar jämförelser mellan den officiella modellen och snabbare community-varianter; trådens författare rapporterar att en av dessa, i hans test, oftare hamnade i en loop.

Varför det spelar roll

För ett små och medelstort företag eller en MSP är nyheten inte att en lokal modell slår de bästa molntjänsterna: ingen säger det, inte ens tråden. Det är att tröskeln för «tillräckligt bra» för repetitiva uppgifter, som skript, små refaktoreringar och administrationsautomatiseringar, idag nås med en enda 24 GB GPU, eller med 16 GB om man accepterar vissa kompromisser.

  • Data: kod och dokument lämnar inte ditt nätverk, vilket förenklar GDPR-diskussionen med kunderna.
  • Kostnader: du betalar för hårdvara och energi istället för token; det lönar sig om användningen är konstant, mindre om den är sporadisk.
  • Begränsningar: modellen resonerar länge, så den är långsam vid interaktiva uppgifter; den måste placeras i en sandbox och dess ändringar måste granskas, precis som för vilken agent som helst.

Ett realistiskt första steg är att installera Ollama på en arbetsstation med GPU, köra ollama run qwen3.8 och ge den en verklig men lågriskuppgift, till exempel ett underhållsskript på ett testrepo. Om du vill förstå vilken mix mellan lokala modeller och molntjänster som är meningsfull för ditt företag, hittar du vår strategi på sidan för tjänster inom artificiell intelligens.

Källor: Qwen3.8-27B:s datablad på Hugging Face, tråd på r/LocalLLaMA, Ollama-biblioteket, qwen3.8.