Indispensáveis para o funcionamento do site (sessão, preferências, segurança). Sempre ativos.
Que modelo de IA o seu hardware consegue correr?
Escolha um modelo, um nível de quantização e quantas pessoas o vão usar ao mesmo tempo — obtenha uma estimativa honesta de memória, que GPUs ou Macs realmente chegam, e se comprar hardware compensa mais do que pagar por token de API. Nada é enviado para um servidor: tudo é calculado no seu navegador.
1. Configurar
Pressupõe um modelo denso — para o seu próprio fine-tune ou um modelo fora da lista.
2. Memória necessária
Como calculamos isto
Pesos ≈ parâmetros × bits por peso ÷ 8 × 1,1 (margem de 10% para buffers e ativações em tempo de execução).
A "largura KV" é o tamanho da saída de atenção do modelo após a redução grouped-query — publicada na configuração de alguns modelos, estimada a partir de arquiteturas comparáveis nos restantes (ver fontes abaixo).
O DeepSeek-V3 comprime a chave e o valor num único vetor latente partilhado por token (Multi-head Latent Attention) em vez de duas caches de largura total, pelo que a sua cache KV é muito mais pequena do que a fórmula genérica acima — usamos a dimensão comprimida indicada no seu relatório técnico.
São estimativas, não garantias. O uso real varia com o motor de inferência, a estratégia de batching e a forma dos prompts.
3. O que cabe
Apenas compatibilidade de memória — nunca inventamos números de tokens por segundo que não conseguimos medir.
| Hardware | Memória | Resultado |
|---|---|---|
| RTX 4060 Ti 16GB | 16 GB | Cabe |
| RTX 4090 24GB | 24 GB | Cabe |
| RTX 5090 32GB | 32 GB | Cabe |
| 2× RTX 4090 (48GB) | 48 GB | Cabe |
| RTX 6000-class 48GB | 48 GB | Cabe |
| RTX 6000-class 96GB | 96 GB | Cabe |
| Apple M-series 32GB | 32 GB | Cabe |
| Apple M-series 64GB | 64 GB | Cabe |
| Apple M-series 128GB | 128 GB | Cabe |
| NVIDIA DGX Spark-class 128GB | 128 GB | Cabe |
"Cabe" deixa margem para o sistema operativo e outras aplicações. "No limite" significa que essa margem é ultrapassada até 15% — um contexto mais curto ou uma quantização mais agressiva fechariam a diferença.
4. Comprar hardware ou pagar por token?
Edite qualquer número abaixo — são pontos de partida, não os nossos preços.
Amortizado ao longo de 36 meses
Pressupostos
- As estimativas de memória assumem que todo o modelo e a sua cache KV cabem ao mesmo tempo em VRAM ou memória unificada — sem offload para a RAM do sistema.
- O fator de sobrecarga de 1,1× é uma margem aproximada para buffers e memória de ativação em tempo de execução, não um valor medido de nenhum motor de inferência específico.
- A largura da cache KV está confirmada pela configuração oficial em alguns modelos e estimada a partir de arquiteturas comparáveis noutros — ver fontes.
- Quantização abaixo de Q8 muda o comportamento do modelo, não só o tamanho do ficheiro — verifique sempre a qualidade para o seu caso de uso.
- A compatibilidade de hardware compara a memória necessária com um pressuposto fixo de memória utilizável por dispositivo; a margem real depende do seu sistema operativo, drivers e do que mais estiver a correr.
- A comparação de custos ignora manutenção, depreciação além dos 36 meses e o valor do seu próprio tempo.
Fontes
O número de parâmetros é verificado com base na ficha oficial, no relatório técnico ou na configuração Hugging Face de cada modelo:
- Llama 3.1 8B — Meta — Llama 3 model card
- Llama 3.1 70B — Meta — Llama 3.1 70B (Hugging Face config)
- Llama 3.3 70B — Meta — Llama 3.3 70B (same architecture as 3.1 70B)
- Qwen3 8B — Alibaba — Qwen3-8B model card
- Qwen3 32B — Alibaba — Qwen3-32B model card
- Qwen3 235B-A22B — Alibaba — Qwen3-235B-A22B model card
- Gemma 3 12B — Google — Gemma 3 Technical Report (Table 1)
- Gemma 3 27B — Google — Gemma 3 Technical Report (Table 1)
- Mistral Small 24B — Mistral AI — Mistral Small 3.1/3.2 (24B) model card
- gpt-oss-20b — OpenAI — gpt-oss model card (Table 1)
- gpt-oss-120b — OpenAI — gpt-oss model card (Table 1)
- DeepSeek-V3 — DeepSeek — DeepSeek-V3 technical report + model card
- GLM-4.5-Air — Z.ai — GLM-4.5-Air model card
- GLM-4.5 — Z.ai — GLM-4.5 model card
- Llama 3.1 405B — Meta — Llama 3.1 405B (Hugging Face config)
Precisa disto em produção, e não só estimado?
A Altovar implementa IA soberana e local para empresas europeias — no seu próprio hardware ou num data center da UE, sem que nenhum dado saia da sua infraestrutura. Veja como a Altovar leva a IA local para produção →