Indispensables au fonctionnement du site (session, préférences, sécurité). Toujours actifs.
Quel modèle IA votre matériel peut-il faire tourner ?
Choisissez un modèle, un niveau de quantisation et le nombre d'utilisateurs simultanés : obtenez une estimation honnête de la mémoire nécessaire, quels GPU ou Mac suffisent vraiment, et si acheter du matériel est plus rentable que payer par token d'API. Rien n'est envoyé à un serveur : tout se calcule dans votre navigateur.
1. Configurer
Hypothèse de modèle dense — pour votre propre fine-tune ou un modèle absent de la liste.
2. Mémoire nécessaire
Comment on calcule ça
Poids ≈ paramètres × bits par poids ÷ 8 × 1,1 (marge de 10 % pour les buffers et activations à l'exécution).
La « largeur KV » est la taille de sortie d'attention du modèle après réduction grouped-query — publiée dans la configuration de certains modèles, estimée à partir d'architectures comparables pour les autres (voir les sources plus bas).
DeepSeek-V3 compresse clé et valeur en un seul vecteur latent partagé par token (Multi-head Latent Attention) au lieu de deux caches pleine largeur, donc son cache KV est bien plus petit que la formule générique ci-dessus — nous utilisons la dimension compressée indiquée dans son rapport technique.
Ce sont des estimations, pas des garanties. L'usage réel varie selon le moteur d'inférence, la stratégie de batching et la forme des prompts.
3. Ce qui rentre
Uniquement la compatibilité mémoire — nous n'inventons jamais de chiffres de tokens par seconde que nous ne pouvons pas mesurer.
| Matériel | Mémoire | Résultat |
|---|---|---|
| RTX 4060 Ti 16GB | 16 GB | Rentre |
| RTX 4090 24GB | 24 GB | Rentre |
| RTX 5090 32GB | 32 GB | Rentre |
| 2× RTX 4090 (48GB) | 48 GB | Rentre |
| RTX 6000-class 48GB | 48 GB | Rentre |
| RTX 6000-class 96GB | 96 GB | Rentre |
| Apple M-series 32GB | 32 GB | Rentre |
| Apple M-series 64GB | 64 GB | Rentre |
| Apple M-series 128GB | 128 GB | Rentre |
| NVIDIA DGX Spark-class 128GB | 128 GB | Rentre |
« Rentre » laisse de la marge pour le système et les autres applications. « Juste » signifie qu'on dépasse cette marge de 15 % au maximum — un contexte plus court ou une quantisation plus agressive comblerait l'écart.
4. Acheter du matériel ou payer par token ?
Modifiez les valeurs ci-dessous — ce sont des points de départ, pas nos prix.
Amorti sur 36 mois
Hypothèses
- Les estimations de mémoire supposent que le modèle entier et son cache KV tiennent ensemble en VRAM ou mémoire unifiée — aucun déchargement vers la RAM système.
- Le facteur de marge 1,1× est une estimation approximative pour les buffers et la mémoire d'activation à l'exécution, pas une mesure réelle d'un moteur d'inférence particulier.
- La largeur du cache KV est confirmée par la configuration officielle pour certains modèles et estimée à partir d'architectures comparables pour d'autres — voir les sources.
- Une quantisation en dessous de Q8 modifie le comportement du modèle, pas seulement la taille du fichier — vérifiez toujours la qualité pour votre propre usage.
- La compatibilité matérielle compare la mémoire requise à une hypothèse fixe de mémoire utilisable par appareil ; la marge réelle dépend de votre système d'exploitation, des pilotes et de ce qui tourne par ailleurs.
- La comparaison de coûts ignore la maintenance, l'amortissement au-delà de 36 mois et la valeur de votre propre temps.
Sources
Le nombre de paramètres est vérifié à partir de la fiche officielle, du rapport technique ou de la configuration Hugging Face de chaque modèle :
- Llama 3.1 8B — Meta — Llama 3 model card
- Llama 3.1 70B — Meta — Llama 3.1 70B (Hugging Face config)
- Llama 3.3 70B — Meta — Llama 3.3 70B (same architecture as 3.1 70B)
- Qwen3 8B — Alibaba — Qwen3-8B model card
- Qwen3 32B — Alibaba — Qwen3-32B model card
- Qwen3 235B-A22B — Alibaba — Qwen3-235B-A22B model card
- Gemma 3 12B — Google — Gemma 3 Technical Report (Table 1)
- Gemma 3 27B — Google — Gemma 3 Technical Report (Table 1)
- Mistral Small 24B — Mistral AI — Mistral Small 3.1/3.2 (24B) model card
- gpt-oss-20b — OpenAI — gpt-oss model card (Table 1)
- gpt-oss-120b — OpenAI — gpt-oss model card (Table 1)
- DeepSeek-V3 — DeepSeek — DeepSeek-V3 technical report + model card
- GLM-4.5-Air — Z.ai — GLM-4.5-Air model card
- GLM-4.5 — Z.ai — GLM-4.5 model card
- Llama 3.1 405B — Meta — Llama 3.1 405B (Hugging Face config)
Besoin de le mettre en production, pas seulement de l'estimer ?
Altovar déploie de l'IA souveraine et locale pour les entreprises européennes — sur votre propre matériel ou dans un data center européen, sans qu'aucune donnée ne quitte votre infrastructure. Découvrez comment Altovar déploie l'IA locale en production →