Indispensabili per il funzionamento del sito (login, preferenze, sicurezza). Sempre attivi.
Quale modello AI gira sul tuo server?
Scegli un modello, un livello di quantizzazione e quante persone lo useranno insieme: ottieni una stima onesta della memoria necessaria, quali GPU o Mac ce la fanno davvero, e se conviene comprare hardware o pagare a token via API. Niente viene inviato a un server: gira tutto nel tuo browser.
1. Configura
Ipotesi di modello denso — per un tuo fine-tune o un modello non in lista.
2. Memoria necessaria
Come lo calcoliamo
Pesi ≈ parametri × bit per peso ÷ 8 × 1,1 (margine del 10% per buffer e attivazioni a runtime).
La "larghezza KV" è la dimensione dell'output di attenzione del modello dopo la riduzione grouped-query — pubblicata in alcune configurazioni, stimata da architetture comparabili per le altre (vedi le fonti più sotto).
DeepSeek-V3 comprime chiave e valore in un unico vettore latente condiviso per token (Multi-head Latent Attention) invece di due cache a piena larghezza, quindi la sua cache KV è molto più piccola della formula generica sopra — usiamo la dimensione compressa indicata nel suo technical report.
Sono stime, non garanzie. L'uso reale varia in base al motore di inferenza, alla strategia di batching e alla forma dei prompt.
3. Cosa ci sta
Solo compatibilità di memoria — non inventiamo mai numeri di token al secondo che non possiamo misurare.
| Hardware | Memoria | Esito |
|---|---|---|
| RTX 4060 Ti 16GB | 16 GB | Ci sta |
| RTX 4090 24GB | 24 GB | Ci sta |
| RTX 5090 32GB | 32 GB | Ci sta |
| 2× RTX 4090 (48GB) | 48 GB | Ci sta |
| RTX 6000-class 48GB | 48 GB | Ci sta |
| RTX 6000-class 96GB | 96 GB | Ci sta |
| Apple M-series 32GB | 32 GB | Ci sta |
| Apple M-series 64GB | 64 GB | Ci sta |
| Apple M-series 128GB | 128 GB | Ci sta |
| NVIDIA DGX Spark-class 128GB | 128 GB | Ci sta |
"Ci sta" lascia margine per il sistema operativo e altre app. "Al limite" significa che si supera quel margine di massimo il 15% — un contesto più corto o una quantizzazione più aggressiva colmerebbero il divario.
4. Comprare hardware o pagare a token?
Modifica pure ogni numero qui sotto — sono punti di partenza, non i nostri prezzi.
Ammortizzato su 36 mesi
Ipotesi
- Le stime di memoria presuppongono che l'intero modello e la sua cache KV stiano tutti in VRAM o memoria unificata insieme — nessun offload sulla RAM di sistema.
- Il fattore di overhead 1,1× è un margine approssimativo per buffer e memoria di attivazione a runtime, non una misura reale di un motore di inferenza specifico.
- La larghezza della cache KV è confermata dalla configurazione ufficiale per alcuni modelli e stimata da architetture comparabili per gli altri — vedi le fonti.
- Una quantizzazione sotto Q8 cambia il comportamento del modello, non solo la dimensione del file — verifica sempre la qualità per il tuo caso d'uso.
- La compatibilità hardware confronta la memoria richiesta con un'ipotesi fissa di memoria utilizzabile per dispositivo; il margine reale dipende dal tuo sistema operativo, driver e da cos'altro è in esecuzione.
- Il confronto dei costi ignora manutenzione, deprezzamento oltre i 36 mesi e il valore del tuo tempo.
Fonti
Il numero di parametri è verificato sulla scheda ufficiale, il technical report o la configurazione Hugging Face di ogni modello:
- Llama 3.1 8B — Meta — Llama 3 model card
- Llama 3.1 70B — Meta — Llama 3.1 70B (Hugging Face config)
- Llama 3.3 70B — Meta — Llama 3.3 70B (same architecture as 3.1 70B)
- Qwen3 8B — Alibaba — Qwen3-8B model card
- Qwen3 32B — Alibaba — Qwen3-32B model card
- Qwen3 235B-A22B — Alibaba — Qwen3-235B-A22B model card
- Gemma 3 12B — Google — Gemma 3 Technical Report (Table 1)
- Gemma 3 27B — Google — Gemma 3 Technical Report (Table 1)
- Mistral Small 24B — Mistral AI — Mistral Small 3.1/3.2 (24B) model card
- gpt-oss-20b — OpenAI — gpt-oss model card (Table 1)
- gpt-oss-120b — OpenAI — gpt-oss model card (Table 1)
- DeepSeek-V3 — DeepSeek — DeepSeek-V3 technical report + model card
- GLM-4.5-Air — Z.ai — GLM-4.5-Air model card
- GLM-4.5 — Z.ai — GLM-4.5 model card
- Llama 3.1 405B — Meta — Llama 3.1 405B (Hugging Face config)
Ti serve in produzione, non solo stimato?
Altovar realizza deployment di AI sovrana e locale per le aziende europee — sul tuo hardware o in un data center UE, senza che nessun dato lasci la tua infrastruttura. Scopri come Altovar porta l'AI locale in produzione →