Erforderlich für den Betrieb der Seite (Login, Einstellungen, Sicherheit). Immer aktiv.
Welches KI-Modell läuft auf Ihrer Hardware?
Wählen Sie ein Modell, eine Quantisierungsstufe und die Anzahl gleichzeitiger Nutzer — Sie erhalten eine ehrliche Speicherschätzung, welche GPUs oder Macs wirklich ausreichen, und ob sich Hardware-Kauf gegenüber API-Kosten pro Token lohnt. Es wird nichts an einen Server gesendet: alles läuft im Browser.
1. Konfigurieren
Annahme: dichtes Modell — für ein eigenes Fine-Tune oder ein Modell, das nicht in der Liste steht.
2. Benötigter Speicher
So berechnen wir das
Gewichte ≈ Parameter × Bits pro Gewicht ÷ 8 × 1,1 (10% Zuschlag für Laufzeitpuffer und Aktivierungen).
Die "KV-Breite" ist die Größe der Attention-Ausgabe nach Grouped-Query-Reduktion — bei manchen Modellen aus der Konfiguration bekannt, bei anderen anhand vergleichbarer Architekturen geschätzt (siehe Quellen unten).
DeepSeek-V3 komprimiert Key und Value pro Token in einen gemeinsamen latenten Vektor (Multi-head Latent Attention) statt zwei volle Caches zu führen — der KV-Cache ist dadurch deutlich kleiner als bei der allgemeinen Formel oben; wir nutzen die komprimierte Dimension aus dem technischen Report.
Das sind Schätzungen, keine Garantien. Der tatsächliche Bedarf hängt von der Inference-Engine, der Batching-Strategie und der Prompt-Form ab.
3. Was passt
Nur Speicherkompatibilität — wir erfinden keine Tokens-pro-Sekunde-Werte, die wir nicht messen können.
| Hardware | Speicher | Ergebnis |
|---|---|---|
| RTX 4060 Ti 16GB | 16 GB | Passt |
| RTX 4090 24GB | 24 GB | Passt |
| RTX 5090 32GB | 32 GB | Passt |
| 2× RTX 4090 (48GB) | 48 GB | Passt |
| RTX 6000-class 48GB | 48 GB | Passt |
| RTX 6000-class 96GB | 96 GB | Passt |
| Apple M-series 32GB | 32 GB | Passt |
| Apple M-series 64GB | 64 GB | Passt |
| Apple M-series 128GB | 128 GB | Passt |
| NVIDIA DGX Spark-class 128GB | 128 GB | Passt |
"Passt" lässt Spielraum für Betriebssystem und andere Programme. "Knapp" heißt, dieser Spielraum wird um bis zu 15% überschritten — ein kürzerer Kontext oder stärkere Quantisierung würde die Lücke schließen.
4. Hardware kaufen oder pro Token zahlen?
Alle Werte unten sind editierbar — es sind Ausgangspunkte, nicht unsere Preise.
Abgeschrieben über 36 Monate
Annahmen
- Die Speicherschätzung geht davon aus, dass das gesamte Modell samt KV-Cache gleichzeitig im VRAM oder Unified Memory liegt — kein Offloading auf System-RAM.
- Der Overhead-Faktor 1,1× ist ein grober Zuschlag für Laufzeitpuffer und Aktivierungsspeicher, kein gemessener Wert einer bestimmten Inference-Engine.
- Die KV-Cache-Breite ist bei manchen Modellen aus der offiziellen Konfiguration bestätigt, bei anderen anhand vergleichbarer Architekturen geschätzt — siehe Quellen.
- Quantisierung unterhalb von Q8 verändert das Modellverhalten, nicht nur die Dateigröße — prüfen Sie die Qualität immer für Ihren eigenen Anwendungsfall.
- Die Hardware-Einschätzung vergleicht den Speicherbedarf mit einer festen Annahme zum nutzbaren Speicher pro Gerät; der tatsächliche Spielraum hängt von Betriebssystem, Treibern und anderen laufenden Programmen ab.
- Der Kostenvergleich berücksichtigt weder Wartung noch Abschreibung über 36 Monate hinaus noch den Wert Ihrer eigenen Zeit.
Quellen
Die Parameteranzahl wird anhand der offiziellen Modellkarte, des technischen Reports oder der Hugging-Face-Konfiguration jedes Modells geprüft:
- Llama 3.1 8B — Meta — Llama 3 model card
- Llama 3.1 70B — Meta — Llama 3.1 70B (Hugging Face config)
- Llama 3.3 70B — Meta — Llama 3.3 70B (same architecture as 3.1 70B)
- Qwen3 8B — Alibaba — Qwen3-8B model card
- Qwen3 32B — Alibaba — Qwen3-32B model card
- Qwen3 235B-A22B — Alibaba — Qwen3-235B-A22B model card
- Gemma 3 12B — Google — Gemma 3 Technical Report (Table 1)
- Gemma 3 27B — Google — Gemma 3 Technical Report (Table 1)
- Mistral Small 24B — Mistral AI — Mistral Small 3.1/3.2 (24B) model card
- gpt-oss-20b — OpenAI — gpt-oss model card (Table 1)
- gpt-oss-120b — OpenAI — gpt-oss model card (Table 1)
- DeepSeek-V3 — DeepSeek — DeepSeek-V3 technical report + model card
- GLM-4.5-Air — Z.ai — GLM-4.5-Air model card
- GLM-4.5 — Z.ai — GLM-4.5 model card
- Llama 3.1 405B — Meta — Llama 3.1 405B (Hugging Face config)
Brauchen Sie das in Produktion, nicht nur geschätzt?
Altovar setzt souveräne, lokale KI für europäische Unternehmen um — auf Ihrer eigenen Hardware oder in einem EU-Rechenzentrum, ohne dass Daten Ihre Infrastruktur verlassen. So bringt Altovar lokale KI in Produktion →
Neu dabei, Modelle lokal zu betreiben? 3 Repos, die jedes KMU für lokale KI kennen sollte →