Nodig voor de werking van de site (login, voorkeuren, beveiliging). Altijd aan.
Qwen 3.8 27B: op r/LocalLLaMA zijn er gebruikers die gestopt zijn met betalen voor API's
Een open-weight model met 27 miljard parameters draait op één enkele GPU en is, volgens gebruikers, voldoende voor dagelijks werk. Dit is wat bevestigd is en wat persoonlijke ervaring betreft.
In dit artikel
De meest besproken post van de afgelopen dagen op r/LocalLLaMA heeft een titel die klinkt als een provocatie: «Qwen-3.8-27B is good enough that I stopped using API» (in de praktijk: het model is goed genoeg om betaalde API's te vervangen). Het is geen benchmark of aankondiging, maar het verhaal van een gebruiker, dat de vraag raakt die veel MKB's al maanden bezighoudt: kan een model dat op kantoor draait het werk van een cloudservice doen?

Wat bevestigd is
Qwen3.8-27B is een model van het Qwen-team van Alibaba, gepubliceerd medio augustus 2026 met open weights op Hugging Face, onder Apache 2.0-licentie: het mag ook voor commerciële doeleinden worden gebruikt. Het is een dicht model met 27 miljard parameters, zonder mixture-of-experts-architectuur, met 64 lagen die Gated DeltaNet en klassieke aandacht afwisselen, een beeld-encoder en een native context van 262.144 tokens, uitbreidbaar tot een miljoen.
Op de modelkaart vermeldt Qwen onder andere 61,7 op SWE-bench Pro en 73,0 op Terminal Bench 2.1. Dit zijn cijfers van de producent, geen onafhankelijke metingen. Voor productiegebruik adviseert Qwen engines zoals vLLM of SGLang; voor lokale tests zijn er gekwantiseerde versies beschikbaar voor llama.cpp, Ollama en LM Studio. In de Ollama-bibliotheek neemt de gekwantiseerde 27B-versie 18 GB in beslag.
Wat er gezegd wordt
De auteur van de thread vertelt dat hij Q4_K_S-kwantisatie gebruikt met de contextcache op Q8_0, binnen de programmeeragent Pi, met weinig tools (shell, lezen, schrijven, bestanden wijzigen) en Docker als sandbox. Volgens hem «denkt» het model «heel veel» en is het frustrerend om het aan het werk te zien, maar als het met rust gelaten wordt, voltooit het complexe refactoringtaken door verstandige beslissingen te nemen. Het zwakke punt, schrijft hij, is de tool voor het bewerken van bestanden: het model moet vaak opnieuw proberen omdat het de inspringing verkeerd doet.
Wat de kosten betreft, schat de gebruiker dat met zijn hardware en elektriciteitstarief een miljoen tokens hem ongeveer 2,4 cent kost voor invoer en 70 cent voor uitvoer, bedragen die hij vergelijkbaar acht met de goedkoopste API-providers. Dit is een persoonlijke, niet-verifieerbare berekening, die de prijs van de machine niet omvat.
Onder de reacties zegt een andere gebruiker met een 16 GB GPU dat hij IQ4_XS-kwantisatie gebruikt met technieken om de context uit te breiden tot meer dan 160.000 tokens en dat hij het nu als zijn enige model beschouwt voor ontwikkeling, beveiliging en IT-beheer. Op dezelfde subreddit circuleren vergelijkingen tussen het officiële model en snellere community-varianten; de auteur van de thread meldt dat een van deze, in zijn test, vaker in een loop terechtkwam.
Waarom het ertoe doet
Voor een MKB of MSP is het nieuws niet dat een lokaal model de beste cloudservices verslaat: dat zegt niemand, zelfs de thread niet. Het is dat de drempel van «goed genoeg» voor repetitieve taken, zoals scripts, kleine refactoring en administratieve automatiseringen, vandaag de dag wordt bereikt met slechts één 24 GB GPU, of met 16 GB als je enkele compromissen accepteert.
- Gegevens: code en documenten verlaten uw netwerk niet, wat de GDPR-discussie met klanten vereenvoudigt.
- Kosten: u betaalt voor hardware en energie in plaats van tokens; dit is voordelig bij constant gebruik, minder bij incidenteel gebruik.
- Beperkingen: het model denkt lang na, dus het is traag bij interactieve taken; het moet in een sandbox worden geplaatst en de wijzigingen moeten worden gecontroleerd, net als die van elke andere agent.
Een realistische eerste stap is om Ollama op een workstation met GPU te installeren, ollama run qwen3.8 te starten en het een echte, maar risicovolle taak te geven, bijvoorbeeld een onderhoudsscript op een testrepository. Als u wilt begrijpen welke mix van lokale en cloudmodellen zinvol is voor uw bedrijf, vindt u onze aanpak op de pagina met kunstmatige intelligentiediensten.
Bronnen: Qwen3.8-27B-modelkaart op Hugging Face, thread op r/LocalLLaMA, Ollama-bibliotheek, qwen3.8.