DARMOWE NARZĘDZIE

Jaki model AI uruchomi ten sprzęt?

Wybierz model, poziom kwantyzacji i liczbę jednoczesnych użytkowników — otrzymasz rzetelne oszacowanie potrzebnej pamięci, informację, które GPU lub Maki faktycznie wystarczą, oraz czy zakup sprzętu opłaca się bardziej niż płacenie za token API. Nic nie jest wysyłane na serwer: wszystko liczy się w przeglądarce.

1. Konfiguracja

2. Wymagana pamięć

Wagi modelu4.10 GB
Pamięć podręczna KV1.00 GB
Suma wymagana5.10 GB
Jak to liczymy

Wagi ≈ parametry × bity na wagę ÷ 8 × 1,1 (10% zapasu na bufory i aktywacje w czasie działania).

"Szerokość KV" to rozmiar wyjścia uwagi modelu po redukcji grouped-query — publikowana w konfiguracji niektórych modeli, dla pozostałych szacowana na podstawie porównywalnych architektur (patrz źródła poniżej).

To są szacunki, nie gwarancje. Rzeczywiste zużycie zależy od silnika inferencji, strategii batchowania i kształtu promptów.

3. Co się zmieści

Tylko dopasowanie pamięci — nigdy nie zmyślamy liczby tokenów na sekundę, których nie możemy zmierzyć.

SprzętPamięćWynik
RTX 4060 Ti 16GB 16 GB Mieści się
RTX 4090 24GB 24 GB Mieści się
RTX 5090 32GB 32 GB Mieści się
2× RTX 4090 (48GB) 48 GB Mieści się
RTX 6000-class 48GB 48 GB Mieści się
RTX 6000-class 96GB 96 GB Mieści się
Apple M-series 32GB 32 GB Mieści się
Apple M-series 64GB 64 GB Mieści się
Apple M-series 128GB 128 GB Mieści się
NVIDIA DGX Spark-class 128GB 128 GB Mieści się

"Mieści się" pozostawia zapas dla systemu operacyjnego i innych aplikacji. "Na styk" oznacza przekroczenie tego zapasu o maksymalnie 15% — krótszy kontekst lub mocniejsza kwantyzacja zniwelowałyby różnicę.

4. Kupić sprzęt czy płacić za token?

Możesz zmienić każdą liczbę poniżej — to punkty wyjścia, nie nasze ceny.

Amortyzacja rozłożona na 36 miesięcy

Miesięczny koszt API€60.00
Miesięczny koszt lokalny (amortyzacja sprzętu + prąd)€81.13
Próg opłacalnościPoza 36-miesięcznym okresem amortyzacji przy tym zużyciu

Założenia

  • Szacunki pamięci zakładają, że cały model i jego pamięć podręczna KV mieszczą się jednocześnie w VRAM lub pamięci zunifikowanej — bez offloadingu do RAM-u systemowego.
  • Współczynnik narzutu 1,1× to przybliżony zapas na bufory i pamięć aktywacji w czasie działania, a nie zmierzona wartość konkretnego silnika inferencji.
  • Szerokość pamięci podręcznej KV jest potwierdzona oficjalną konfiguracją dla części modeli, a dla pozostałych szacowana na podstawie porównywalnych architektur — patrz źródła.
  • Kwantyzacja poniżej Q8 zmienia zachowanie modelu, nie tylko rozmiar pliku — zawsze sprawdź jakość dla własnego zastosowania.
  • Dopasowanie sprzętu porównuje wymaganą pamięć ze stałym założeniem dostępnej pamięci dla danego urządzenia; rzeczywisty zapas zależy od systemu operacyjnego, sterowników i innych działających programów.
  • Porównanie kosztów pomija konserwację, amortyzację po 36 miesiącach oraz wartość Twojego czasu.

Źródła

Liczba parametrów jest weryfikowana na podstawie oficjalnej karty modelu, raportu technicznego lub konfiguracji Hugging Face każdego modelu:

Potrzebujesz tego na produkcji, a nie tylko oszacowania?

Altovar wdraża suwerenną, lokalną AI dla europejskich firm — na Twoim własnym sprzęcie lub w centrum danych w UE, bez wysyłania danych poza Twoją infrastrukturę. Zobacz, jak Altovar wdraża lokalną AI na produkcji →

Pierwszy raz uruchamiasz modele lokalnie? 3 repozytoria, które każda MŚP powinna znać w kontekście lokalnej AI →