AI PC · Poradnik

Ile pamięci potrzebuje lokalny model?

Odpowiadają dwa mnożenia. Jedno mówi, czy model się zmieści. Drugie, jak szybko może w ogóle odpowiedzieć, zanim cokolwiek pobierzesz.

Marcin Firmuga·Opublikowano 2026-09-05·9 min czytania

Uruchamianie modelu językowego na własnej maszynie przestało być egzotyką. O tym, czy będzie to przyjemne czy męczące, nie decyduje procesor ani liczba TOPS na pudełku. Decyduje pamięć, w dwóch osobnych znaczeniach, i oba to arytmetyka, którą zrobisz w głowie przed pobraniem dziewięciogigabajtowego pliku.

Pojemność decyduje, czy w ogóle ruszy. Przepustowość decyduje, jak szybko odpowie. Prawie każde rozczarowanie lokalnym AI to jedna z tych dwóch liczb dobrana źle, a żadna z nich nie pojawia się w marketingu laptopów.

W tym poradniku
  1. Mnożenie pierwsze: czy się zmieści
  2. Co jeszcze zajmuje pamięć
  3. Mnożenie drugie: jak szybko może być
  4. To samo działanie na prawdziwych maszynach
  5. Dlaczego NPU tego nie ratuje
  6. Co uruchomić na tym, co masz

Mnożenie pierwsze: czy się zmieści

Model to stos liczb zwanych parametrami. Ile zajmuje miejsca, to liczba parametrów razy rozmiar każdej liczby, a rozmiar wynika z formatu:

FormatBajty na parametrModel 8BJakość
FP32432 GBFormat treningowy. Nikt tego nie uruchamia lokalnie.
FP16 / BF16216 GBPunkt odniesienia. To zwykle znaczy „pełna precyzja".
8 bitów18 GBBardzo blisko odniesienia w większości zastosowań.
4 bity (popularne k-quanty)~0,5 do 0,6~4,5 do 5 GBZwykły wybór. Mała, mierzalna strata, której większość ludzi nie zauważa.

To cała zasada: parametry razy bajty na parametr. Model 3B na 4 bitach to poniżej dwóch gigabajtów. Model 70B na 4 bitach to około czterdziestu. Kolumna 4-bitowa jest nieco powyżej teoretycznych 0,5 bajta, bo te formaty trzymają część wartości w wyższej precyzji tam, gdzie to ma znaczenie, i dlatego „czterobitowy" plik 8B na dysku ma bliżej pięciu gigabajtów niż czterech.

Co jeszcze zajmuje pamięć

Wagi to duża liczba, ale nie jedyna.

Pamięć kontekstu. Czytając twój prompt i pisząc odpowiedź, model trzyma bufor stanu pośredniego dla każdego tokenu rozmowy. Rośnie z długością rozmowy i przy małym modelu z długim kontekstem potrafi sięgnąć gigabajta i więcej. Dlatego model, który zaczynał dobrze, robi się cięższy w głąb długiego czatu i dlatego zwiększanie okna kontekstu nie jest darmowe.

Środowisko uruchomieniowe i system. Windows i przeglądarka z przyjemnością zajmą razem sześć do ośmiu gigabajtów, zanim zaczniesz. Pamięć, której nie ma, ląduje na dysku, a model, który wylewa się na dysk, nie działa wolno, tylko przestaje nadawać się do użytku.

Planuj model plus około dwóch gigabajtów, w granicach tego, czego system jeszcze nie zajął. Na laptopie z 16 GB i otwartą przeglądarką realny budżet na model to osiem do dziewięciu gigabajtów, a nie szesnaście. To wygodne dla 8B na 4 bitach i ciasne dla 14B.

Mnożenie drugie: jak szybko może być

Tej części prawie nikt nie tłumaczy, a przewiduje twoje doświadczenie lepiej niż jakakolwiek lista benchmarków.

Żeby wyprodukować jeden token, model czyta wszystkie swoje wagi. Każdy token. Sufit prędkości generowania to zatem po prostu:

tokeny na sekundę  =  przepustowość pamięci  /  rozmiar modelu w pamięci

Model 4,5 GB na maszynie o przepustowości 135 GB/s: 135 / 4,5 = 30 tokenów na sekundę, i tej wartości nie przekroczysz nawet przy idealnej implementacji. Realne wyjście zwykle ląduje między połową a trzema czwartymi tej liczby.

Wynikają z tego od razu dwie rzeczy i obie są nieoczywiste, dopóki nie zobaczy się wzoru.

Mniejszy model jest szybszy wprost proporcjonalnie. Zmniejsz model o połowę i podwoisz sufit. Dlatego kwantyzacja 4-bitowa nie tylko sprawia, że model się mieści, ale też czyni go mniej więcej dwa razy szybszym niż ten sam model na 8 bitach na tym samym sprzęcie.

Szybszy procesor nie pomoże. Jeśli wąskim gardłem jest czytanie wag z pamięci, więcej mocy obliczeniowej nie ma co robić. To jedyny powód, dla którego laptop z imponującą liczbą TOPS potrafi być wolniejszy w czacie niż desktopowa karta graficzna z tego samego rocznika.

To samo działanie na prawdziwych maszynach

Przepustowość pamięci to szerokość szyny razy tempo transferu, więc możesz ją policzyć zamiast szukać. Szyna 128-bitowa ma 16 bajtów, więc LPDDR5X przy 8533 MT/s daje 8533 × 16 = około 136 GB/s. Szyna GDDR6X 384-bitowa ma 48 bajtów, więc 21 Gb/s na pin daje 48 × 21 = około 1008 GB/s.

MaszynaPrzepustowość (ok.)Sufit dla modelu 4,5 GBSufit dla modelu 20 GB
Typowy cienki laptop, DDR5-5600 dwukanałowo~90 GB/s~20 tok/snie mieści się w maszynie 16 GB
Klasa Copilot+, LPDDR5X-8533 na 128 bitach~136 GB/s~30 tok/s~7 tok/s, jeśli się zmieści
Karta desktopowa, GDDR6X 384-bit przy 21 Gb/s~1008 GB/s~220 tok/s~50 tok/s
Karta desktopowa, GDDR7 512-bit przy 28 Gb/s~1792 GB/s~400 tok/s~90 tok/s

Różnica między górnym a dolnym wierszem to mniej więcej dwadzieścia razy i nic z tego nie wynika z tego, jak sprytny jest układ. Wynika z tego, ile bajtów na sekundę da się wyciągnąć z pamięci. To też jest uczciwa odpowiedź na pytanie „laptop AI czy karta graficzna": jeśli celem jest duży model odpowiadający szybko, kupuj przepustowość.

Dlaczego NPU tego nie ratuje

NPU jest bardzo dobre w tym, do czego je zbudowano, a to nie jest to.

W laptopie NPU zwykle nie ma własnej pamięci. Pożycza RAM systemowy i dlatego Windows raportuje dla większości maszyn Pamięć współdzieloną NPU, a nie dedykowaną. Dzielenie RAM oznacza dzielenie jego przepustowości, więc sufit z poprzedniej sekcji obowiązuje NPU dokładnie tak samo jak procesor.

NPU zmienia rachunek za prąd. Ten sam mały model, działający bez przerwy, kosztuje ułamek watów, jakie pobrałby na procesorze albo zintegrowanej grafice, a reszta maszyny zostaje wolna i cicha. Dla modelu pracującego godzinami w tle to jest cały sens. Dla dużego modelu, na który czekasz, to nie jest ta dźwignia. Nasz poradnik co naprawdę mierzy TOPS opisuje, czemu nagłówkowa liczba nigdy o tym nie wspomina.

Jest jeszcze druga, bardziej praktyczna przeszkoda. Model uruchomi się na NPU tylko wtedy, gdy został skwantyzowany i skompilowany pod ten sprzęt, a Windows ML przechodzi na GPU albo CPU, gdy tak nie jest. Uczciwe pytanie nie brzmi więc „czy moje NPU jest wystarczająco szybkie do tego modelu", tylko „czy ten model w ogóle istnieje w wersji pod moje NPU". Dziś, dla większości modeli, odpowiedź brzmi nie.

Co uruchomić na tym, co masz

MaszWygodnieMożliwe, ale ciasnoNie ma sensu
8 GB RAM łącznie3B na 4 bitach7-8B na 4 bitach bez niczego innegocokolwiek powyżej 8B
16 GB RAM łącznie7-8B na 4 bitach14B na 4 bitach30B i więcej
32 GB RAM łącznie14B na 4 bitach30B na 4 bitach, powoli70B
Karta graficzna 8 GB7-8B na 4 bitach, szybko14B na 4 bitach częściowo przeniesionecokolwiek, co wyleje się do RAM
Karta graficzna 24 GB30B na 4 bitach70B na 4 bitach, częściowo

„Ciasno" w tej tabeli znaczy, że zadziała i to poczujesz: mniej miejsca na długą rozmowę i wyraźne spowolnienie w miarę rośnięcia kontekstu. Dzielenie modelu między kartę graficzną a RAM systemowy działa i biegnie z prędkością wolniejszej połowy, czyli RAM systemowego.

Wersja w jednym zdaniu. Pojemność to parametry razy bajty na parametr. Prędkość to przepustowość podzielona przez to. Cała reszta specyfikacji laptopa AI jest szczegółem nałożonym na te dwa mnożenia.

Gdzie w tym jest PC Workman

Tego, czego nie oszacujesz z tabeli, jest jedno: ile twoja maszyna zajmuje, zanim model wystartuje. A to da się dziś zmierzyć. PC Workman czyta presję pamięci, to, co ją trzyma, i to, czy system zaczął wysyłać strony na dysk, czyli moment, w którym lokalny model przechodzi z wolnego w bezużyteczny.

Nie czyta liczników NPU i nie mierzy modeli. Powie ci natomiast, czy osiem gigabajtów, które planowałeś przeznaczyć na model, jest u ciebie faktycznie wolne, czy zabrała je już przeglądarka i launcher.

Sprawdź, co naprawdę robi twoja pamięć. PC Workman czyta presję pamięci, procesy, które ją trzymają, i moment, w którym Windows zaczyna stronicować, więc znasz realny budżet przed pobraniem modelu. Za darmo i open source. Analiza działa lokalnie. Pobierz na Windows.

Powiązane: dlaczego RAM jest tak obciążony · ile VRAM do gier · wszystkie poradniki →

MF

Marcin Firmuga

Twórca PC Workmana · HCK_Labs

Buduję publicznie monitor Windows z lokalnym asystentem AI. Każdy poradnik opiera się na tym, co faktycznie pokazują liczniki, łącznie z tymi, które nie pokazują nic.

Liczby dotyczące pojemności i przepustowości to arytmetyka, którą możesz powtórzyć: bajty na parametr razy liczba parametrów oraz szerokość szyny w bajtach razy tempo transferu. Kontekst platformy za Microsoftem: Copilot+ PCs developer guide (kwantyzacja do formatów całkowitych, pamięć współdzielona NPU) oraz Windows ML execution providers (wybór dostawcy i przejście na GPU albo CPU).