FERRAMENTA GRATUITA

Que modelo de IA o seu hardware consegue correr?

Escolha um modelo, um nível de quantização e quantas pessoas o vão usar ao mesmo tempo — obtenha uma estimativa honesta de memória, que GPUs ou Macs realmente chegam, e se comprar hardware compensa mais do que pagar por token de API. Nada é enviado para um servidor: tudo é calculado no seu navegador.

1. Configurar

2. Memória necessária

Pesos do modelo4.10 GB
Cache KV1.00 GB
Total necessário5.10 GB
Como calculamos isto

Pesos ≈ parâmetros × bits por peso ÷ 8 × 1,1 (margem de 10% para buffers e ativações em tempo de execução).

A "largura KV" é o tamanho da saída de atenção do modelo após a redução grouped-query — publicada na configuração de alguns modelos, estimada a partir de arquiteturas comparáveis nos restantes (ver fontes abaixo).

São estimativas, não garantias. O uso real varia com o motor de inferência, a estratégia de batching e a forma dos prompts.

3. O que cabe

Apenas compatibilidade de memória — nunca inventamos números de tokens por segundo que não conseguimos medir.

HardwareMemóriaResultado
RTX 4060 Ti 16GB 16 GB Cabe
RTX 4090 24GB 24 GB Cabe
RTX 5090 32GB 32 GB Cabe
2× RTX 4090 (48GB) 48 GB Cabe
RTX 6000-class 48GB 48 GB Cabe
RTX 6000-class 96GB 96 GB Cabe
Apple M-series 32GB 32 GB Cabe
Apple M-series 64GB 64 GB Cabe
Apple M-series 128GB 128 GB Cabe
NVIDIA DGX Spark-class 128GB 128 GB Cabe

"Cabe" deixa margem para o sistema operativo e outras aplicações. "No limite" significa que essa margem é ultrapassada até 15% — um contexto mais curto ou uma quantização mais agressiva fechariam a diferença.

4. Comprar hardware ou pagar por token?

Edite qualquer número abaixo — são pontos de partida, não os nossos preços.

Amortizado ao longo de 36 meses

Custo mensal de API€60.00
Custo local mensal (hardware amortizado + eletricidade)€81.13
Ponto de equilíbrioAlém da janela de amortização de 36 meses com este uso

Pressupostos

  • As estimativas de memória assumem que todo o modelo e a sua cache KV cabem ao mesmo tempo em VRAM ou memória unificada — sem offload para a RAM do sistema.
  • O fator de sobrecarga de 1,1× é uma margem aproximada para buffers e memória de ativação em tempo de execução, não um valor medido de nenhum motor de inferência específico.
  • A largura da cache KV está confirmada pela configuração oficial em alguns modelos e estimada a partir de arquiteturas comparáveis noutros — ver fontes.
  • Quantização abaixo de Q8 muda o comportamento do modelo, não só o tamanho do ficheiro — verifique sempre a qualidade para o seu caso de uso.
  • A compatibilidade de hardware compara a memória necessária com um pressuposto fixo de memória utilizável por dispositivo; a margem real depende do seu sistema operativo, drivers e do que mais estiver a correr.
  • A comparação de custos ignora manutenção, depreciação além dos 36 meses e o valor do seu próprio tempo.

Fontes

O número de parâmetros é verificado com base na ficha oficial, no relatório técnico ou na configuração Hugging Face de cada modelo:

Precisa disto em produção, e não só estimado?

A Altovar implementa IA soberana e local para empresas europeias — no seu próprio hardware ou num data center da UE, sem que nenhum dado saia da sua infraestrutura. Veja como a Altovar leva a IA local para produção →

Está a começar a correr modelos em local? 3 repositórios que toda a PME devia conhecer para IA local →