INSTRUMENT GRATUIT

Ce model AI poate rula hardware-ul tău?

Alege un model, un nivel de cuantizare și câți utilizatori îl vor folosi simultan — obții o estimare corectă a memoriei necesare, ce plăci video sau Mac-uri fac față cu adevărat, și dacă merită să cumperi hardware în loc să plătești pe token API. Nimic nu este trimis către un server: totul se calculează în browser.

1. Configurează

2. Memorie necesară

Greutățile modelului4.10 GB
Cache KV1.00 GB
Total necesar5.10 GB
Cum calculăm asta

Greutăți ≈ parametri × biți per parametru ÷ 8 × 1,1 (o marjă de 10% pentru buffere și activări la runtime).

"Lățimea KV" este dimensiunea ieșirii de atenție a modelului după reducerea grouped-query — publicată în configurația unor modele, estimată din arhitecturi comparabile pentru celelalte (vezi sursele de mai jos).

Acestea sunt estimări, nu garanții. Utilizarea reală variază în funcție de motorul de inferență, strategia de batching și forma promptului.

3. Ce se potrivește

Doar compatibilitate de memorie — nu inventăm niciodată cifre de tokeni pe secundă pe care nu le putem măsura.

HardwareMemorieRezultat
RTX 4060 Ti 16GB 16 GB Se potrivește
RTX 4090 24GB 24 GB Se potrivește
RTX 5090 32GB 32 GB Se potrivește
2× RTX 4090 (48GB) 48 GB Se potrivește
RTX 6000-class 48GB 48 GB Se potrivește
RTX 6000-class 96GB 96 GB Se potrivește
Apple M-series 32GB 32 GB Se potrivește
Apple M-series 64GB 64 GB Se potrivește
Apple M-series 128GB 128 GB Se potrivește
NVIDIA DGX Spark-class 128GB 128 GB Se potrivește

"Se potrivește" lasă o marjă pentru sistemul de operare și alte aplicații. "La limită" înseamnă că acea marjă este depășită cu până la 15% — un context mai scurt sau o cuantizare mai agresivă ar acoperi diferența.

4. Cumperi hardware sau plătești pe token?

Poți edita orice cifră de mai jos — sunt puncte de plecare, nu prețurile noastre.

Amortizat pe 36 de luni

Cost lunar API€60.00
Cost local lunar (hardware amortizat + electricitate)€81.13
Prag de rentabilitateDincolo de fereastra de amortizare de 36 de luni la această utilizare

Ipoteze

  • Estimările de memorie presupun că întregul model și cache-ul său KV încap simultan în VRAM sau memorie unificată — fără offload către RAM-ul sistemului.
  • Factorul de marjă de 1,1× este o aproximare pentru buffere și memoria de activare la runtime, nu o valoare măsurată pentru un anumit motor de inferență.
  • Lățimea cache-ului KV este confirmată din configurația oficială pentru unele modele și estimată din arhitecturi comparabile pentru celelalte — vezi sursele.
  • Cuantizarea sub Q8 schimbă comportamentul modelului, nu doar dimensiunea fișierului — verifică mereu calitatea pentru propriul tău caz de utilizare.
  • Compatibilitatea hardware compară memoria necesară cu o ipoteză fixă de memorie utilizabilă per dispozitiv; marja reală depinde de sistemul de operare, drivere și ce altceva rulează.
  • Comparația de costuri ignoră mentenanța, deprecierea după 36 de luni și valoarea propriului tău timp.

Surse

Numărul de parametri este verificat pe baza fișei oficiale, a raportului tehnic sau a configurației Hugging Face pentru fiecare model:

Ai nevoie de asta în producție, nu doar estimat?

Altovar implementează AI suverană, locală, pentru companii europene — pe propriul tău hardware sau într-un centru de date din UE, fără ca datele să iasă din infrastructura ta. Vezi cum aduce Altovar AI locală în producție →

Ești la început cu rularea modelelor local? 3 repo-uri pe care orice IMM ar trebui să le cunoască pentru AI locală →