HERRAMIENTA GRATUITA

¿Qué modelo de IA puede ejecutar tu hardware?

Elige un modelo, un nivel de cuantización y cuántas personas lo usarán a la vez: obtén una estimación honesta de memoria, qué GPUs o Mac son realmente suficientes, y si comprar hardware compensa frente a pagar por token de API. Nada se envía a un servidor: todo se calcula en tu navegador.

1. Configura

2. Memoria necesaria

Pesos del modelo4.10 GB
Caché KV1.00 GB
Total requerido5.10 GB
Cómo lo calculamos

Pesos ≈ parámetros × bits por peso ÷ 8 × 1,1 (un 10% adicional para buffers y activaciones en tiempo de ejecución).

El "ancho KV" es el tamaño de salida de atención del modelo tras la reducción grouped-query — publicado en la configuración de algunos modelos, estimado a partir de arquitecturas comparables en otros (ver fuentes más abajo).

Son estimaciones, no garantías. El uso real varía según el motor de inferencia, la estrategia de batching y la forma de los prompts.

3. Qué encaja

Solo compatibilidad de memoria — nunca inventamos cifras de tokens por segundo que no podemos medir.

HardwareMemoriaResultado
RTX 4060 Ti 16GB 16 GB Encaja
RTX 4090 24GB 24 GB Encaja
RTX 5090 32GB 32 GB Encaja
2× RTX 4090 (48GB) 48 GB Encaja
RTX 6000-class 48GB 48 GB Encaja
RTX 6000-class 96GB 96 GB Encaja
Apple M-series 32GB 32 GB Encaja
Apple M-series 64GB 64 GB Encaja
Apple M-series 128GB 128 GB Encaja
NVIDIA DGX Spark-class 128GB 128 GB Encaja

"Encaja" deja margen para el sistema operativo y otras apps. "Justo" significa que se supera ese margen hasta en un 15% — un contexto más corto o una cuantización más agresiva cerrarían la diferencia.

4. ¿Comprar hardware o pagar por token?

Edita cualquier número de abajo — son puntos de partida, no nuestros precios.

Amortizado en 36 meses

Coste mensual de API€60.00
Coste local mensual (hardware amortizado + electricidad)€81.13
Punto de equilibrioMás allá de la ventana de amortización de 36 meses con este uso

Supuestos

  • Las estimaciones de memoria asumen que todo el modelo y su caché KV caben a la vez en VRAM o memoria unificada — sin offload a la RAM del sistema.
  • El factor de overhead 1,1× es un margen aproximado para buffers y memoria de activación en tiempo de ejecución, no una medición real de ningún motor de inferencia concreto.
  • El ancho de la caché KV está confirmado por la configuración oficial en algunos modelos y estimado a partir de arquitecturas comparables en otros — ver fuentes.
  • Una cuantización por debajo de Q8 cambia el comportamiento del modelo, no solo el tamaño del archivo — comprueba siempre la calidad para tu caso de uso.
  • La compatibilidad de hardware compara la memoria requerida con una estimación fija de memoria utilizable por dispositivo; el margen real depende de tu sistema operativo, drivers y qué más se esté ejecutando.
  • La comparación de costes ignora el mantenimiento, la depreciación más allá de los 36 meses y el valor de tu propio tiempo.

Fuentes

El número de parámetros se verifica contra la ficha oficial, el informe técnico o la configuración de Hugging Face de cada modelo:

¿Necesitas esto en producción, no solo estimado?

Altovar despliega IA soberana y local para empresas europeas — en tu propio hardware o en un centro de datos de la UE, sin que ningún dato salga de tu infraestructura. Descubre cómo Altovar lleva la IA local a producción →

¿Es tu primera vez ejecutando modelos en local? 3 repositorios que toda pyme debería conocer para IA local →