OUTIL GRATUIT

Quel modèle IA votre matériel peut-il faire tourner ?

Choisissez un modèle, un niveau de quantisation et le nombre d'utilisateurs simultanés : obtenez une estimation honnête de la mémoire nécessaire, quels GPU ou Mac suffisent vraiment, et si acheter du matériel est plus rentable que payer par token d'API. Rien n'est envoyé à un serveur : tout se calcule dans votre navigateur.

1. Configurer

2. Mémoire nécessaire

Poids du modèle4.10 GB
Cache KV1.00 GB
Total requis5.10 GB
Comment on calcule ça

Poids ≈ paramètres × bits par poids ÷ 8 × 1,1 (marge de 10 % pour les buffers et activations à l'exécution).

La « largeur KV » est la taille de sortie d'attention du modèle après réduction grouped-query — publiée dans la configuration de certains modèles, estimée à partir d'architectures comparables pour les autres (voir les sources plus bas).

Ce sont des estimations, pas des garanties. L'usage réel varie selon le moteur d'inférence, la stratégie de batching et la forme des prompts.

3. Ce qui rentre

Uniquement la compatibilité mémoire — nous n'inventons jamais de chiffres de tokens par seconde que nous ne pouvons pas mesurer.

MatérielMémoireRésultat
RTX 4060 Ti 16GB 16 GB Rentre
RTX 4090 24GB 24 GB Rentre
RTX 5090 32GB 32 GB Rentre
2× RTX 4090 (48GB) 48 GB Rentre
RTX 6000-class 48GB 48 GB Rentre
RTX 6000-class 96GB 96 GB Rentre
Apple M-series 32GB 32 GB Rentre
Apple M-series 64GB 64 GB Rentre
Apple M-series 128GB 128 GB Rentre
NVIDIA DGX Spark-class 128GB 128 GB Rentre

« Rentre » laisse de la marge pour le système et les autres applications. « Juste » signifie qu'on dépasse cette marge de 15 % au maximum — un contexte plus court ou une quantisation plus agressive comblerait l'écart.

4. Acheter du matériel ou payer par token ?

Modifiez les valeurs ci-dessous — ce sont des points de départ, pas nos prix.

Amorti sur 36 mois

Coût API mensuel€60.00
Coût local mensuel (matériel amorti + électricité)€81.13
Seuil de rentabilitéAu-delà de la fenêtre d'amortissement de 36 mois à cet usage

Hypothèses

  • Les estimations de mémoire supposent que le modèle entier et son cache KV tiennent ensemble en VRAM ou mémoire unifiée — aucun déchargement vers la RAM système.
  • Le facteur de marge 1,1× est une estimation approximative pour les buffers et la mémoire d'activation à l'exécution, pas une mesure réelle d'un moteur d'inférence particulier.
  • La largeur du cache KV est confirmée par la configuration officielle pour certains modèles et estimée à partir d'architectures comparables pour d'autres — voir les sources.
  • Une quantisation en dessous de Q8 modifie le comportement du modèle, pas seulement la taille du fichier — vérifiez toujours la qualité pour votre propre usage.
  • La compatibilité matérielle compare la mémoire requise à une hypothèse fixe de mémoire utilisable par appareil ; la marge réelle dépend de votre système d'exploitation, des pilotes et de ce qui tourne par ailleurs.
  • La comparaison de coûts ignore la maintenance, l'amortissement au-delà de 36 mois et la valeur de votre propre temps.

Sources

Le nombre de paramètres est vérifié à partir de la fiche officielle, du rapport technique ou de la configuration Hugging Face de chaque modèle :

Besoin de le mettre en production, pas seulement de l'estimer ?

Altovar déploie de l'IA souveraine et locale pour les entreprises européennes — sur votre propre matériel ou dans un data center européen, sans qu'aucune donnée ne quitte votre infrastructure. Découvrez comment Altovar déploie l'IA locale en production →

Nouveau dans l'exécution de modèles en local ? 3 dépôts que chaque PME devrait connaître pour l'IA locale →