Wymagane do działania strony (logowanie, preferencje, bezpieczeństwo). Zawsze włączone.
Jaki model AI uruchomi ten sprzęt?
Wybierz model, poziom kwantyzacji i liczbę jednoczesnych użytkowników — otrzymasz rzetelne oszacowanie potrzebnej pamięci, informację, które GPU lub Maki faktycznie wystarczą, oraz czy zakup sprzętu opłaca się bardziej niż płacenie za token API. Nic nie jest wysyłane na serwer: wszystko liczy się w przeglądarce.
1. Konfiguracja
Założenie: model gęsty — na potrzeby własnego fine-tune'u lub modelu spoza listy.
2. Wymagana pamięć
Jak to liczymy
Wagi ≈ parametry × bity na wagę ÷ 8 × 1,1 (10% zapasu na bufory i aktywacje w czasie działania).
"Szerokość KV" to rozmiar wyjścia uwagi modelu po redukcji grouped-query — publikowana w konfiguracji niektórych modeli, dla pozostałych szacowana na podstawie porównywalnych architektur (patrz źródła poniżej).
DeepSeek-V3 kompresuje klucz i wartość w jeden wspólny wektor latentny na token (Multi-head Latent Attention) zamiast dwóch pełnowymiarowych pamięci podręcznych, więc jego pamięć KV jest znacznie mniejsza niż wynikałoby z ogólnego wzoru powyżej — używamy skompresowanego wymiaru podanego w jego raporcie technicznym.
To są szacunki, nie gwarancje. Rzeczywiste zużycie zależy od silnika inferencji, strategii batchowania i kształtu promptów.
3. Co się zmieści
Tylko dopasowanie pamięci — nigdy nie zmyślamy liczby tokenów na sekundę, których nie możemy zmierzyć.
| Sprzęt | Pamięć | Wynik |
|---|---|---|
| RTX 4060 Ti 16GB | 16 GB | Mieści się |
| RTX 4090 24GB | 24 GB | Mieści się |
| RTX 5090 32GB | 32 GB | Mieści się |
| 2× RTX 4090 (48GB) | 48 GB | Mieści się |
| RTX 6000-class 48GB | 48 GB | Mieści się |
| RTX 6000-class 96GB | 96 GB | Mieści się |
| Apple M-series 32GB | 32 GB | Mieści się |
| Apple M-series 64GB | 64 GB | Mieści się |
| Apple M-series 128GB | 128 GB | Mieści się |
| NVIDIA DGX Spark-class 128GB | 128 GB | Mieści się |
"Mieści się" pozostawia zapas dla systemu operacyjnego i innych aplikacji. "Na styk" oznacza przekroczenie tego zapasu o maksymalnie 15% — krótszy kontekst lub mocniejsza kwantyzacja zniwelowałyby różnicę.
4. Kupić sprzęt czy płacić za token?
Możesz zmienić każdą liczbę poniżej — to punkty wyjścia, nie nasze ceny.
Amortyzacja rozłożona na 36 miesięcy
Założenia
- Szacunki pamięci zakładają, że cały model i jego pamięć podręczna KV mieszczą się jednocześnie w VRAM lub pamięci zunifikowanej — bez offloadingu do RAM-u systemowego.
- Współczynnik narzutu 1,1× to przybliżony zapas na bufory i pamięć aktywacji w czasie działania, a nie zmierzona wartość konkretnego silnika inferencji.
- Szerokość pamięci podręcznej KV jest potwierdzona oficjalną konfiguracją dla części modeli, a dla pozostałych szacowana na podstawie porównywalnych architektur — patrz źródła.
- Kwantyzacja poniżej Q8 zmienia zachowanie modelu, nie tylko rozmiar pliku — zawsze sprawdź jakość dla własnego zastosowania.
- Dopasowanie sprzętu porównuje wymaganą pamięć ze stałym założeniem dostępnej pamięci dla danego urządzenia; rzeczywisty zapas zależy od systemu operacyjnego, sterowników i innych działających programów.
- Porównanie kosztów pomija konserwację, amortyzację po 36 miesiącach oraz wartość Twojego czasu.
Źródła
Liczba parametrów jest weryfikowana na podstawie oficjalnej karty modelu, raportu technicznego lub konfiguracji Hugging Face każdego modelu:
- Llama 3.1 8B — Meta — Llama 3 model card
- Llama 3.1 70B — Meta — Llama 3.1 70B (Hugging Face config)
- Llama 3.3 70B — Meta — Llama 3.3 70B (same architecture as 3.1 70B)
- Qwen3 8B — Alibaba — Qwen3-8B model card
- Qwen3 32B — Alibaba — Qwen3-32B model card
- Qwen3 235B-A22B — Alibaba — Qwen3-235B-A22B model card
- Gemma 3 12B — Google — Gemma 3 Technical Report (Table 1)
- Gemma 3 27B — Google — Gemma 3 Technical Report (Table 1)
- Mistral Small 24B — Mistral AI — Mistral Small 3.1/3.2 (24B) model card
- gpt-oss-20b — OpenAI — gpt-oss model card (Table 1)
- gpt-oss-120b — OpenAI — gpt-oss model card (Table 1)
- DeepSeek-V3 — DeepSeek — DeepSeek-V3 technical report + model card
- GLM-4.5-Air — Z.ai — GLM-4.5-Air model card
- GLM-4.5 — Z.ai — GLM-4.5 model card
- Llama 3.1 405B — Meta — Llama 3.1 405B (Hugging Face config)
Potrzebujesz tego na produkcji, a nie tylko oszacowania?
Altovar wdraża suwerenną, lokalną AI dla europejskich firm — na Twoim własnym sprzęcie lub w centrum danych w UE, bez wysyłania danych poza Twoją infrastrukturę. Zobacz, jak Altovar wdraża lokalną AI na produkcji →