KOSTENLOSES TOOL

Welches KI-Modell läuft auf Ihrer Hardware?

Wählen Sie ein Modell, eine Quantisierungsstufe und die Anzahl gleichzeitiger Nutzer — Sie erhalten eine ehrliche Speicherschätzung, welche GPUs oder Macs wirklich ausreichen, und ob sich Hardware-Kauf gegenüber API-Kosten pro Token lohnt. Es wird nichts an einen Server gesendet: alles läuft im Browser.

1. Konfigurieren

2. Benötigter Speicher

Modellgewichte4.10 GB
KV-Cache1.00 GB
Gesamt benötigt5.10 GB
So berechnen wir das

Gewichte ≈ Parameter × Bits pro Gewicht ÷ 8 × 1,1 (10% Zuschlag für Laufzeitpuffer und Aktivierungen).

Die "KV-Breite" ist die Größe der Attention-Ausgabe nach Grouped-Query-Reduktion — bei manchen Modellen aus der Konfiguration bekannt, bei anderen anhand vergleichbarer Architekturen geschätzt (siehe Quellen unten).

Das sind Schätzungen, keine Garantien. Der tatsächliche Bedarf hängt von der Inference-Engine, der Batching-Strategie und der Prompt-Form ab.

3. Was passt

Nur Speicherkompatibilität — wir erfinden keine Tokens-pro-Sekunde-Werte, die wir nicht messen können.

HardwareSpeicherErgebnis
RTX 4060 Ti 16GB 16 GB Passt
RTX 4090 24GB 24 GB Passt
RTX 5090 32GB 32 GB Passt
2× RTX 4090 (48GB) 48 GB Passt
RTX 6000-class 48GB 48 GB Passt
RTX 6000-class 96GB 96 GB Passt
Apple M-series 32GB 32 GB Passt
Apple M-series 64GB 64 GB Passt
Apple M-series 128GB 128 GB Passt
NVIDIA DGX Spark-class 128GB 128 GB Passt

"Passt" lässt Spielraum für Betriebssystem und andere Programme. "Knapp" heißt, dieser Spielraum wird um bis zu 15% überschritten — ein kürzerer Kontext oder stärkere Quantisierung würde die Lücke schließen.

4. Hardware kaufen oder pro Token zahlen?

Alle Werte unten sind editierbar — es sind Ausgangspunkte, nicht unsere Preise.

Abgeschrieben über 36 Monate

Monatliche API-Kosten€60.00
Monatliche lokale Kosten (abgeschriebene Hardware + Strom)€81.13
Break-evenJenseits des 36-Monats-Abschreibungszeitraums bei dieser Nutzung

Annahmen

  • Die Speicherschätzung geht davon aus, dass das gesamte Modell samt KV-Cache gleichzeitig im VRAM oder Unified Memory liegt — kein Offloading auf System-RAM.
  • Der Overhead-Faktor 1,1× ist ein grober Zuschlag für Laufzeitpuffer und Aktivierungsspeicher, kein gemessener Wert einer bestimmten Inference-Engine.
  • Die KV-Cache-Breite ist bei manchen Modellen aus der offiziellen Konfiguration bestätigt, bei anderen anhand vergleichbarer Architekturen geschätzt — siehe Quellen.
  • Quantisierung unterhalb von Q8 verändert das Modellverhalten, nicht nur die Dateigröße — prüfen Sie die Qualität immer für Ihren eigenen Anwendungsfall.
  • Die Hardware-Einschätzung vergleicht den Speicherbedarf mit einer festen Annahme zum nutzbaren Speicher pro Gerät; der tatsächliche Spielraum hängt von Betriebssystem, Treibern und anderen laufenden Programmen ab.
  • Der Kostenvergleich berücksichtigt weder Wartung noch Abschreibung über 36 Monate hinaus noch den Wert Ihrer eigenen Zeit.

Quellen

Die Parameteranzahl wird anhand der offiziellen Modellkarte, des technischen Reports oder der Hugging-Face-Konfiguration jedes Modells geprüft:

Brauchen Sie das in Produktion, nicht nur geschätzt?

Altovar setzt souveräne, lokale KI für europäische Unternehmen um — auf Ihrer eigenen Hardware oder in einem EU-Rechenzentrum, ohne dass Daten Ihre Infrastruktur verlassen. So bringt Altovar lokale KI in Produktion →

Neu dabei, Modelle lokal zu betreiben? 3 Repos, die jedes KMU für lokale KI kennen sollte →