GRATIS TOOL

Welk AI-model kan jouw hardware draaien?

Kies een model, een quantisatieniveau en het aantal gelijktijdige gebruikers — je krijgt een eerlijke geheugenschatting, welke GPU's of Macs echt volstaan, en of hardware kopen voordeliger is dan betalen per API-token. Er wordt niets naar een server gestuurd: alles gebeurt in je browser.

1. Configureren

2. Benodigd geheugen

Modelgewichten4.10 GB
KV-cache1.00 GB
Totaal nodig5.10 GB
Hoe we dit berekenen

Gewichten ≈ parameters × bits per gewicht ÷ 8 × 1,1 (10% marge voor runtime-buffers en activaties).

De "KV-breedte" is de attention-outputgrootte van het model na grouped-query-reductie — bij sommige modellen bekend uit de configuratie, bij andere geschat op basis van vergelijkbare architecturen (zie bronnen hieronder).

Dit zijn schattingen, geen garanties. Het werkelijke gebruik hangt af van de inference-engine, de batching-strategie en de vorm van de prompts.

3. Wat past

Alleen geheugencompatibiliteit — we verzinnen nooit tokens-per-seconde-cijfers die we niet kunnen meten.

HardwareGeheugenResultaat
RTX 4060 Ti 16GB 16 GB Past
RTX 4090 24GB 24 GB Past
RTX 5090 32GB 32 GB Past
2× RTX 4090 (48GB) 48 GB Past
RTX 6000-class 48GB 48 GB Past
RTX 6000-class 96GB 96 GB Past
Apple M-series 32GB 32 GB Past
Apple M-series 64GB 64 GB Past
Apple M-series 128GB 128 GB Past
NVIDIA DGX Spark-class 128GB 128 GB Past

"Past" laat ruimte voor het besturingssysteem en andere apps. "Krap" betekent dat die marge met maximaal 15% wordt overschreden — een kortere context of zwaardere quantisatie zou het verschil opheffen.

4. Hardware kopen of per token betalen?

Pas elk getal hieronder aan — dit zijn startpunten, geen prijzen van ons.

Afgeschreven over 36 maanden

Maandelijkse API-kosten€60.00
Maandelijkse lokale kosten (afgeschreven hardware + stroom)€81.13
Break-evenVoorbij de afschrijvingsperiode van 36 maanden bij dit gebruik

Aannames

  • De geheugenschatting gaat ervan uit dat het hele model en de KV-cache tegelijk in VRAM of unified memory passen — geen offloading naar systeem-RAM.
  • De overhead-factor van 1,1× is een ruwe marge voor runtime-buffers en activatiegeheugen, geen gemeten waarde van een specifieke inference-engine.
  • De breedte van de KV-cache is bij sommige modellen bevestigd via de officiële configuratie en bij andere geschat op basis van vergelijkbare architecturen — zie bronnen.
  • Quantisatie onder Q8 verandert het gedrag van het model, niet alleen de bestandsgrootte — controleer altijd de kwaliteit voor jouw eigen gebruik.
  • De hardwarecompatibiliteit vergelijkt het benodigde geheugen met een vaste aanname over bruikbaar geheugen per apparaat; de werkelijke marge hangt af van je besturingssysteem, drivers en wat er verder nog draait.
  • De kostenvergelijking houdt geen rekening met onderhoud, afschrijving na 36 maanden of de waarde van je eigen tijd.

Bronnen

Het aantal parameters is gecontroleerd aan de hand van de officiële modelkaart, het technisch rapport of de Hugging Face-configuratie van elk model:

Wil je dit in productie, niet alleen geschat?

Altovar zet soevereine, lokale AI in voor Europese bedrijven — op je eigen hardware of in een EU-datacenter, zonder dat data je infrastructuur verlaat. Bekijk hoe Altovar lokale AI in productie brengt →

Nieuw met lokaal modellen draaien? 3 repo's die elke mkb-onderneming moet kennen voor lokale AI →