Krävs för att webbplatsen ska fungera (inloggning, inställningar, säkerhet). Alltid på.
Vilken AI-modell klarar din hårdvara?
Välj en modell, en kvantiseringsnivå och hur många som använder den samtidigt — få en ärlig minnesuppskattning, vilka GPU:er eller Mac som faktiskt räcker, och om det lönar sig att köpa hårdvara i stället för att betala per API-token. Inget skickas till en server: allt beräknas i din webbläsare.
1. Ställ in
Antagande: tät modell — för din egen finjustering eller en modell som inte finns i listan.
2. Minne som behövs
Så räknar vi ut det här
Vikter ≈ parametrar × bitar per vikt ÷ 8 × 1,1 (10% marginal för runtime-buffertar och aktiveringar).
"KV-bredd" är modellens attention-utdatastorlek efter grouped-query-reduktion — publicerad i konfigurationen för vissa modeller, uppskattad utifrån jämförbara arkitekturer för andra (se källor nedan).
DeepSeek-V3 komprimerar key och value till en delad latent vektor per token (Multi-head Latent Attention) i stället för två fullbreda cachar, så dess KV-cache är mycket mindre än standardformeln ovan — vi använder den komprimerade dimensionen från dess tekniska rapport.
Det här är uppskattningar, inga garantier. Verklig användning varierar med inferensmotor, batchningsstrategi och promptens form.
3. Vad som får plats
Enbart minnespassform — vi hittar aldrig på tokens-per-sekund-siffror som vi inte kan mäta.
| Hårdvara | Minne | Resultat |
|---|---|---|
| RTX 4060 Ti 16GB | 16 GB | Får plats |
| RTX 4090 24GB | 24 GB | Får plats |
| RTX 5090 32GB | 32 GB | Får plats |
| 2× RTX 4090 (48GB) | 48 GB | Får plats |
| RTX 6000-class 48GB | 48 GB | Får plats |
| RTX 6000-class 96GB | 96 GB | Får plats |
| Apple M-series 32GB | 32 GB | Får plats |
| Apple M-series 64GB | 64 GB | Får plats |
| Apple M-series 128GB | 128 GB | Får plats |
| NVIDIA DGX Spark-class 128GB | 128 GB | Får plats |
"Får plats" lämnar marginal för operativsystemet och andra program. "Trångt" betyder att den marginalen överskrids med upp till 15% — en kortare kontext eller hårdare kvantisering skulle täcka skillnaden.
4. Köpa hårdvara eller betala per token?
Redigera valfritt tal nedan — det här är utgångspunkter, inte våra priser.
Avskrivet över 36 månader
Antaganden
- Minnesuppskattningen förutsätter att hela modellen och dess KV-cache ligger samtidigt i VRAM eller unified memory — ingen avlastning till system-RAM.
- Overheadfaktorn 1,1× är en grov marginal för runtime-buffertar och aktiveringsminne, inte ett uppmätt värde för någon specifik inferensmotor.
- KV-cachens bredd är bekräftad utifrån modellens egen konfiguration för vissa poster och uppskattad utifrån jämförbara arkitekturer för andra — se källor.
- Kvantisering under Q8 förändrar modellens beteende, inte bara filstorleken — kontrollera alltid kvaliteten för ditt eget användningsfall.
- Hårdvarupassformen jämför minnesbehovet med ett fast antagande om användbart minne per enhet; den faktiska marginalen beror på ditt operativsystem, drivrutiner och vad annat som körs.
- Kostnadsjämförelsen bortser från underhåll, avskrivning bortom 36 månader och värdet av din egen tid.
Källor
Antalet parametrar kontrolleras mot varje modells officiella modellkort, tekniska rapport eller Hugging Face-konfiguration:
- Llama 3.1 8B — Meta — Llama 3 model card
- Llama 3.1 70B — Meta — Llama 3.1 70B (Hugging Face config)
- Llama 3.3 70B — Meta — Llama 3.3 70B (same architecture as 3.1 70B)
- Qwen3 8B — Alibaba — Qwen3-8B model card
- Qwen3 32B — Alibaba — Qwen3-32B model card
- Qwen3 235B-A22B — Alibaba — Qwen3-235B-A22B model card
- Gemma 3 12B — Google — Gemma 3 Technical Report (Table 1)
- Gemma 3 27B — Google — Gemma 3 Technical Report (Table 1)
- Mistral Small 24B — Mistral AI — Mistral Small 3.1/3.2 (24B) model card
- gpt-oss-20b — OpenAI — gpt-oss model card (Table 1)
- gpt-oss-120b — OpenAI — gpt-oss model card (Table 1)
- DeepSeek-V3 — DeepSeek — DeepSeek-V3 technical report + model card
- GLM-4.5-Air — Z.ai — GLM-4.5-Air model card
- GLM-4.5 — Z.ai — GLM-4.5 model card
- Llama 3.1 405B — Meta — Llama 3.1 405B (Hugging Face config)
Behöver du det här i produktion, inte bara uppskattat?
Altovar sätter upp suverän, lokal AI för europeiska företag — på er egen hårdvara eller i ett EU-datacenter, utan att data lämnar er infrastruktur. Se hur Altovar tar lokal AI till produktion →
Nytt att köra modeller lokalt? 3 repor varje litet/medelstort företag bör känna till för lokal AI →