Nodig voor de werking van de site (login, voorkeuren, beveiliging). Altijd aan.
Welk AI-model kan jouw hardware draaien?
Kies een model, een quantisatieniveau en het aantal gelijktijdige gebruikers — je krijgt een eerlijke geheugenschatting, welke GPU's of Macs echt volstaan, en of hardware kopen voordeliger is dan betalen per API-token. Er wordt niets naar een server gestuurd: alles gebeurt in je browser.
1. Configureren
Uitgangspunt: dicht model — voor je eigen fine-tune of een model dat niet in de lijst staat.
2. Benodigd geheugen
Hoe we dit berekenen
Gewichten ≈ parameters × bits per gewicht ÷ 8 × 1,1 (10% marge voor runtime-buffers en activaties).
De "KV-breedte" is de attention-outputgrootte van het model na grouped-query-reductie — bij sommige modellen bekend uit de configuratie, bij andere geschat op basis van vergelijkbare architecturen (zie bronnen hieronder).
DeepSeek-V3 comprimeert key en value per token tot één gedeelde latente vector (Multi-head Latent Attention) in plaats van twee volledige caches, waardoor de KV-cache veel kleiner is dan de algemene formule hierboven — we gebruiken de gecomprimeerde dimensie uit het technisch rapport.
Dit zijn schattingen, geen garanties. Het werkelijke gebruik hangt af van de inference-engine, de batching-strategie en de vorm van de prompts.
3. Wat past
Alleen geheugencompatibiliteit — we verzinnen nooit tokens-per-seconde-cijfers die we niet kunnen meten.
| Hardware | Geheugen | Resultaat |
|---|---|---|
| RTX 4060 Ti 16GB | 16 GB | Past |
| RTX 4090 24GB | 24 GB | Past |
| RTX 5090 32GB | 32 GB | Past |
| 2× RTX 4090 (48GB) | 48 GB | Past |
| RTX 6000-class 48GB | 48 GB | Past |
| RTX 6000-class 96GB | 96 GB | Past |
| Apple M-series 32GB | 32 GB | Past |
| Apple M-series 64GB | 64 GB | Past |
| Apple M-series 128GB | 128 GB | Past |
| NVIDIA DGX Spark-class 128GB | 128 GB | Past |
"Past" laat ruimte voor het besturingssysteem en andere apps. "Krap" betekent dat die marge met maximaal 15% wordt overschreden — een kortere context of zwaardere quantisatie zou het verschil opheffen.
4. Hardware kopen of per token betalen?
Pas elk getal hieronder aan — dit zijn startpunten, geen prijzen van ons.
Afgeschreven over 36 maanden
Aannames
- De geheugenschatting gaat ervan uit dat het hele model en de KV-cache tegelijk in VRAM of unified memory passen — geen offloading naar systeem-RAM.
- De overhead-factor van 1,1× is een ruwe marge voor runtime-buffers en activatiegeheugen, geen gemeten waarde van een specifieke inference-engine.
- De breedte van de KV-cache is bij sommige modellen bevestigd via de officiële configuratie en bij andere geschat op basis van vergelijkbare architecturen — zie bronnen.
- Quantisatie onder Q8 verandert het gedrag van het model, niet alleen de bestandsgrootte — controleer altijd de kwaliteit voor jouw eigen gebruik.
- De hardwarecompatibiliteit vergelijkt het benodigde geheugen met een vaste aanname over bruikbaar geheugen per apparaat; de werkelijke marge hangt af van je besturingssysteem, drivers en wat er verder nog draait.
- De kostenvergelijking houdt geen rekening met onderhoud, afschrijving na 36 maanden of de waarde van je eigen tijd.
Bronnen
Het aantal parameters is gecontroleerd aan de hand van de officiële modelkaart, het technisch rapport of de Hugging Face-configuratie van elk model:
- Llama 3.1 8B — Meta — Llama 3 model card
- Llama 3.1 70B — Meta — Llama 3.1 70B (Hugging Face config)
- Llama 3.3 70B — Meta — Llama 3.3 70B (same architecture as 3.1 70B)
- Qwen3 8B — Alibaba — Qwen3-8B model card
- Qwen3 32B — Alibaba — Qwen3-32B model card
- Qwen3 235B-A22B — Alibaba — Qwen3-235B-A22B model card
- Gemma 3 12B — Google — Gemma 3 Technical Report (Table 1)
- Gemma 3 27B — Google — Gemma 3 Technical Report (Table 1)
- Mistral Small 24B — Mistral AI — Mistral Small 3.1/3.2 (24B) model card
- gpt-oss-20b — OpenAI — gpt-oss model card (Table 1)
- gpt-oss-120b — OpenAI — gpt-oss model card (Table 1)
- DeepSeek-V3 — DeepSeek — DeepSeek-V3 technical report + model card
- GLM-4.5-Air — Z.ai — GLM-4.5-Air model card
- GLM-4.5 — Z.ai — GLM-4.5 model card
- Llama 3.1 405B — Meta — Llama 3.1 405B (Hugging Face config)
Wil je dit in productie, niet alleen geschat?
Altovar zet soevereine, lokale AI in voor Europese bedrijven — op je eigen hardware of in een EU-datacenter, zonder dat data je infrastructuur verlaat. Bekijk hoe Altovar lokale AI in productie brengt →
Nieuw met lokaal modellen draaien? 3 repo's die elke mkb-onderneming moet kennen voor lokale AI →