STRUMENTO GRATUITO

Quale modello AI gira sul tuo server?

Scegli un modello, un livello di quantizzazione e quante persone lo useranno insieme: ottieni una stima onesta della memoria necessaria, quali GPU o Mac ce la fanno davvero, e se conviene comprare hardware o pagare a token via API. Niente viene inviato a un server: gira tutto nel tuo browser.

1. Configura

2. Memoria necessaria

Pesi del modello4.10 GB
Cache KV1.00 GB
Totale richiesto5.10 GB
Come lo calcoliamo

Pesi ≈ parametri × bit per peso ÷ 8 × 1,1 (margine del 10% per buffer e attivazioni a runtime).

La "larghezza KV" è la dimensione dell'output di attenzione del modello dopo la riduzione grouped-query — pubblicata in alcune configurazioni, stimata da architetture comparabili per le altre (vedi le fonti più sotto).

Sono stime, non garanzie. L'uso reale varia in base al motore di inferenza, alla strategia di batching e alla forma dei prompt.

3. Cosa ci sta

Solo compatibilità di memoria — non inventiamo mai numeri di token al secondo che non possiamo misurare.

HardwareMemoriaEsito
RTX 4060 Ti 16GB 16 GB Ci sta
RTX 4090 24GB 24 GB Ci sta
RTX 5090 32GB 32 GB Ci sta
2× RTX 4090 (48GB) 48 GB Ci sta
RTX 6000-class 48GB 48 GB Ci sta
RTX 6000-class 96GB 96 GB Ci sta
Apple M-series 32GB 32 GB Ci sta
Apple M-series 64GB 64 GB Ci sta
Apple M-series 128GB 128 GB Ci sta
NVIDIA DGX Spark-class 128GB 128 GB Ci sta

"Ci sta" lascia margine per il sistema operativo e altre app. "Al limite" significa che si supera quel margine di massimo il 15% — un contesto più corto o una quantizzazione più aggressiva colmerebbero il divario.

4. Comprare hardware o pagare a token?

Modifica pure ogni numero qui sotto — sono punti di partenza, non i nostri prezzi.

Ammortizzato su 36 mesi

Costo API mensile€60.00
Costo locale mensile (hardware ammortizzato + elettricità)€81.13
PareggioOltre la finestra di ammortamento di 36 mesi a questo livello di utilizzo

Ipotesi

  • Le stime di memoria presuppongono che l'intero modello e la sua cache KV stiano tutti in VRAM o memoria unificata insieme — nessun offload sulla RAM di sistema.
  • Il fattore di overhead 1,1× è un margine approssimativo per buffer e memoria di attivazione a runtime, non una misura reale di un motore di inferenza specifico.
  • La larghezza della cache KV è confermata dalla configurazione ufficiale per alcuni modelli e stimata da architetture comparabili per gli altri — vedi le fonti.
  • Una quantizzazione sotto Q8 cambia il comportamento del modello, non solo la dimensione del file — verifica sempre la qualità per il tuo caso d'uso.
  • La compatibilità hardware confronta la memoria richiesta con un'ipotesi fissa di memoria utilizzabile per dispositivo; il margine reale dipende dal tuo sistema operativo, driver e da cos'altro è in esecuzione.
  • Il confronto dei costi ignora manutenzione, deprezzamento oltre i 36 mesi e il valore del tuo tempo.

Fonti

Il numero di parametri è verificato sulla scheda ufficiale, il technical report o la configurazione Hugging Face di ogni modello:

Ti serve in produzione, non solo stimato?

Altovar realizza deployment di AI sovrana e locale per le aziende europee — sul tuo hardware o in un data center UE, senza che nessun dato lasci la tua infrastruttura. Scopri come Altovar porta l'AI locale in produzione →

Nuovo nel far girare modelli in locale? 3 repository che ogni PMI dovrebbe conoscere per l'AI locale →