Imprescindibles para el funcionamiento del sitio (sesión, preferencias, seguridad). Siempre activas.
¿Qué modelo de IA puede ejecutar tu hardware?
Elige un modelo, un nivel de cuantización y cuántas personas lo usarán a la vez: obtén una estimación honesta de memoria, qué GPUs o Mac son realmente suficientes, y si comprar hardware compensa frente a pagar por token de API. Nada se envía a un servidor: todo se calcula en tu navegador.
1. Configura
Se asume un modelo denso — para tu propio fine-tune o un modelo que no está en la lista.
2. Memoria necesaria
Cómo lo calculamos
Pesos ≈ parámetros × bits por peso ÷ 8 × 1,1 (un 10% adicional para buffers y activaciones en tiempo de ejecución).
El "ancho KV" es el tamaño de salida de atención del modelo tras la reducción grouped-query — publicado en la configuración de algunos modelos, estimado a partir de arquitecturas comparables en otros (ver fuentes más abajo).
DeepSeek-V3 comprime clave y valor en un único vector latente compartido por token (Multi-head Latent Attention) en lugar de dos cachés de ancho completo, por lo que su caché KV es mucho más pequeña que la fórmula genérica de arriba — usamos la dimensión comprimida de su informe técnico.
Son estimaciones, no garantías. El uso real varía según el motor de inferencia, la estrategia de batching y la forma de los prompts.
3. Qué encaja
Solo compatibilidad de memoria — nunca inventamos cifras de tokens por segundo que no podemos medir.
| Hardware | Memoria | Resultado |
|---|---|---|
| RTX 4060 Ti 16GB | 16 GB | Encaja |
| RTX 4090 24GB | 24 GB | Encaja |
| RTX 5090 32GB | 32 GB | Encaja |
| 2× RTX 4090 (48GB) | 48 GB | Encaja |
| RTX 6000-class 48GB | 48 GB | Encaja |
| RTX 6000-class 96GB | 96 GB | Encaja |
| Apple M-series 32GB | 32 GB | Encaja |
| Apple M-series 64GB | 64 GB | Encaja |
| Apple M-series 128GB | 128 GB | Encaja |
| NVIDIA DGX Spark-class 128GB | 128 GB | Encaja |
"Encaja" deja margen para el sistema operativo y otras apps. "Justo" significa que se supera ese margen hasta en un 15% — un contexto más corto o una cuantización más agresiva cerrarían la diferencia.
4. ¿Comprar hardware o pagar por token?
Edita cualquier número de abajo — son puntos de partida, no nuestros precios.
Amortizado en 36 meses
Supuestos
- Las estimaciones de memoria asumen que todo el modelo y su caché KV caben a la vez en VRAM o memoria unificada — sin offload a la RAM del sistema.
- El factor de overhead 1,1× es un margen aproximado para buffers y memoria de activación en tiempo de ejecución, no una medición real de ningún motor de inferencia concreto.
- El ancho de la caché KV está confirmado por la configuración oficial en algunos modelos y estimado a partir de arquitecturas comparables en otros — ver fuentes.
- Una cuantización por debajo de Q8 cambia el comportamiento del modelo, no solo el tamaño del archivo — comprueba siempre la calidad para tu caso de uso.
- La compatibilidad de hardware compara la memoria requerida con una estimación fija de memoria utilizable por dispositivo; el margen real depende de tu sistema operativo, drivers y qué más se esté ejecutando.
- La comparación de costes ignora el mantenimiento, la depreciación más allá de los 36 meses y el valor de tu propio tiempo.
Fuentes
El número de parámetros se verifica contra la ficha oficial, el informe técnico o la configuración de Hugging Face de cada modelo:
- Llama 3.1 8B — Meta — Llama 3 model card
- Llama 3.1 70B — Meta — Llama 3.1 70B (Hugging Face config)
- Llama 3.3 70B — Meta — Llama 3.3 70B (same architecture as 3.1 70B)
- Qwen3 8B — Alibaba — Qwen3-8B model card
- Qwen3 32B — Alibaba — Qwen3-32B model card
- Qwen3 235B-A22B — Alibaba — Qwen3-235B-A22B model card
- Gemma 3 12B — Google — Gemma 3 Technical Report (Table 1)
- Gemma 3 27B — Google — Gemma 3 Technical Report (Table 1)
- Mistral Small 24B — Mistral AI — Mistral Small 3.1/3.2 (24B) model card
- gpt-oss-20b — OpenAI — gpt-oss model card (Table 1)
- gpt-oss-120b — OpenAI — gpt-oss model card (Table 1)
- DeepSeek-V3 — DeepSeek — DeepSeek-V3 technical report + model card
- GLM-4.5-Air — Z.ai — GLM-4.5-Air model card
- GLM-4.5 — Z.ai — GLM-4.5 model card
- Llama 3.1 405B — Meta — Llama 3.1 405B (Hugging Face config)
¿Necesitas esto en producción, no solo estimado?
Altovar despliega IA soberana y local para empresas europeas — en tu propio hardware o en un centro de datos de la UE, sin que ningún dato salga de tu infraestructura. Descubre cómo Altovar lleva la IA local a producción →