GRATIS VERKTYG

Vilken AI-modell klarar din hårdvara?

Välj en modell, en kvantiseringsnivå och hur många som använder den samtidigt — få en ärlig minnesuppskattning, vilka GPU:er eller Mac som faktiskt räcker, och om det lönar sig att köpa hårdvara i stället för att betala per API-token. Inget skickas till en server: allt beräknas i din webbläsare.

1. Ställ in

2. Minne som behövs

Modellvikter4.10 GB
KV-cache1.00 GB
Totalt behov5.10 GB
Så räknar vi ut det här

Vikter ≈ parametrar × bitar per vikt ÷ 8 × 1,1 (10% marginal för runtime-buffertar och aktiveringar).

"KV-bredd" är modellens attention-utdatastorlek efter grouped-query-reduktion — publicerad i konfigurationen för vissa modeller, uppskattad utifrån jämförbara arkitekturer för andra (se källor nedan).

Det här är uppskattningar, inga garantier. Verklig användning varierar med inferensmotor, batchningsstrategi och promptens form.

3. Vad som får plats

Enbart minnespassform — vi hittar aldrig på tokens-per-sekund-siffror som vi inte kan mäta.

HårdvaraMinneResultat
RTX 4060 Ti 16GB 16 GB Får plats
RTX 4090 24GB 24 GB Får plats
RTX 5090 32GB 32 GB Får plats
2× RTX 4090 (48GB) 48 GB Får plats
RTX 6000-class 48GB 48 GB Får plats
RTX 6000-class 96GB 96 GB Får plats
Apple M-series 32GB 32 GB Får plats
Apple M-series 64GB 64 GB Får plats
Apple M-series 128GB 128 GB Får plats
NVIDIA DGX Spark-class 128GB 128 GB Får plats

"Får plats" lämnar marginal för operativsystemet och andra program. "Trångt" betyder att den marginalen överskrids med upp till 15% — en kortare kontext eller hårdare kvantisering skulle täcka skillnaden.

4. Köpa hårdvara eller betala per token?

Redigera valfritt tal nedan — det här är utgångspunkter, inte våra priser.

Avskrivet över 36 månader

Månatlig API-kostnad€60.00
Månatlig lokal kostnad (avskriven hårdvara + el)€81.13
Break-evenBortom 36-månaders avskrivningsperioden vid den här användningen

Antaganden

  • Minnesuppskattningen förutsätter att hela modellen och dess KV-cache ligger samtidigt i VRAM eller unified memory — ingen avlastning till system-RAM.
  • Overheadfaktorn 1,1× är en grov marginal för runtime-buffertar och aktiveringsminne, inte ett uppmätt värde för någon specifik inferensmotor.
  • KV-cachens bredd är bekräftad utifrån modellens egen konfiguration för vissa poster och uppskattad utifrån jämförbara arkitekturer för andra — se källor.
  • Kvantisering under Q8 förändrar modellens beteende, inte bara filstorleken — kontrollera alltid kvaliteten för ditt eget användningsfall.
  • Hårdvarupassformen jämför minnesbehovet med ett fast antagande om användbart minne per enhet; den faktiska marginalen beror på ditt operativsystem, drivrutiner och vad annat som körs.
  • Kostnadsjämförelsen bortser från underhåll, avskrivning bortom 36 månader och värdet av din egen tid.

Källor

Antalet parametrar kontrolleras mot varje modells officiella modellkort, tekniska rapport eller Hugging Face-konfiguration:

Behöver du det här i produktion, inte bara uppskattat?

Altovar sätter upp suverän, lokal AI för europeiska företag — på er egen hårdvara eller i ett EU-datacenter, utan att data lämnar er infrastruktur. Se hur Altovar tar lokal AI till produktion →

Nytt att köra modeller lokalt? 3 repor varje litet/medelstort företag bör känna till för lokal AI →