Indispensabile pentru funcționarea site-ului (autentificare, preferințe, securitate). Mereu active.
Ce model AI poate rula hardware-ul tău?
Alege un model, un nivel de cuantizare și câți utilizatori îl vor folosi simultan — obții o estimare corectă a memoriei necesare, ce plăci video sau Mac-uri fac față cu adevărat, și dacă merită să cumperi hardware în loc să plătești pe token API. Nimic nu este trimis către un server: totul se calculează în browser.
1. Configurează
Se presupune un model dens — pentru propriul tău fine-tuning sau un model care nu e în listă.
2. Memorie necesară
Cum calculăm asta
Greutăți ≈ parametri × biți per parametru ÷ 8 × 1,1 (o marjă de 10% pentru buffere și activări la runtime).
"Lățimea KV" este dimensiunea ieșirii de atenție a modelului după reducerea grouped-query — publicată în configurația unor modele, estimată din arhitecturi comparabile pentru celelalte (vezi sursele de mai jos).
DeepSeek-V3 comprimă cheia și valoarea într-un singur vector latent comun per token (Multi-head Latent Attention) în loc de două cache-uri complete, așa că memoria sa KV este mult mai mică decât formula generică de mai sus — folosim dimensiunea comprimată din raportul său tehnic.
Acestea sunt estimări, nu garanții. Utilizarea reală variază în funcție de motorul de inferență, strategia de batching și forma promptului.
3. Ce se potrivește
Doar compatibilitate de memorie — nu inventăm niciodată cifre de tokeni pe secundă pe care nu le putem măsura.
| Hardware | Memorie | Rezultat |
|---|---|---|
| RTX 4060 Ti 16GB | 16 GB | Se potrivește |
| RTX 4090 24GB | 24 GB | Se potrivește |
| RTX 5090 32GB | 32 GB | Se potrivește |
| 2× RTX 4090 (48GB) | 48 GB | Se potrivește |
| RTX 6000-class 48GB | 48 GB | Se potrivește |
| RTX 6000-class 96GB | 96 GB | Se potrivește |
| Apple M-series 32GB | 32 GB | Se potrivește |
| Apple M-series 64GB | 64 GB | Se potrivește |
| Apple M-series 128GB | 128 GB | Se potrivește |
| NVIDIA DGX Spark-class 128GB | 128 GB | Se potrivește |
"Se potrivește" lasă o marjă pentru sistemul de operare și alte aplicații. "La limită" înseamnă că acea marjă este depășită cu până la 15% — un context mai scurt sau o cuantizare mai agresivă ar acoperi diferența.
4. Cumperi hardware sau plătești pe token?
Poți edita orice cifră de mai jos — sunt puncte de plecare, nu prețurile noastre.
Amortizat pe 36 de luni
Ipoteze
- Estimările de memorie presupun că întregul model și cache-ul său KV încap simultan în VRAM sau memorie unificată — fără offload către RAM-ul sistemului.
- Factorul de marjă de 1,1× este o aproximare pentru buffere și memoria de activare la runtime, nu o valoare măsurată pentru un anumit motor de inferență.
- Lățimea cache-ului KV este confirmată din configurația oficială pentru unele modele și estimată din arhitecturi comparabile pentru celelalte — vezi sursele.
- Cuantizarea sub Q8 schimbă comportamentul modelului, nu doar dimensiunea fișierului — verifică mereu calitatea pentru propriul tău caz de utilizare.
- Compatibilitatea hardware compară memoria necesară cu o ipoteză fixă de memorie utilizabilă per dispozitiv; marja reală depinde de sistemul de operare, drivere și ce altceva rulează.
- Comparația de costuri ignoră mentenanța, deprecierea după 36 de luni și valoarea propriului tău timp.
Surse
Numărul de parametri este verificat pe baza fișei oficiale, a raportului tehnic sau a configurației Hugging Face pentru fiecare model:
- Llama 3.1 8B — Meta — Llama 3 model card
- Llama 3.1 70B — Meta — Llama 3.1 70B (Hugging Face config)
- Llama 3.3 70B — Meta — Llama 3.3 70B (same architecture as 3.1 70B)
- Qwen3 8B — Alibaba — Qwen3-8B model card
- Qwen3 32B — Alibaba — Qwen3-32B model card
- Qwen3 235B-A22B — Alibaba — Qwen3-235B-A22B model card
- Gemma 3 12B — Google — Gemma 3 Technical Report (Table 1)
- Gemma 3 27B — Google — Gemma 3 Technical Report (Table 1)
- Mistral Small 24B — Mistral AI — Mistral Small 3.1/3.2 (24B) model card
- gpt-oss-20b — OpenAI — gpt-oss model card (Table 1)
- gpt-oss-120b — OpenAI — gpt-oss model card (Table 1)
- DeepSeek-V3 — DeepSeek — DeepSeek-V3 technical report + model card
- GLM-4.5-Air — Z.ai — GLM-4.5-Air model card
- GLM-4.5 — Z.ai — GLM-4.5 model card
- Llama 3.1 405B — Meta — Llama 3.1 405B (Hugging Face config)
Ai nevoie de asta în producție, nu doar estimat?
Altovar implementează AI suverană, locală, pentru companii europene — pe propriul tău hardware sau într-un centru de date din UE, fără ca datele să iasă din infrastructura ta. Vezi cum aduce Altovar AI locală în producție →