← Poradniki

Ile RAM potrzebujesz do lokalnych LLM? 16 vs 32 vs 64 GB wyjaśnione

VRAM zbiera całą uwagę, ale to pamięć systemowa po cichu decyduje, co twój laptop w ogóle uruchomi — zwłaszcza na maszynach ze zintegrowaną grafiką, które dominują na rynku poniżej ~2300 zł. Ten przewodnik daje ci matematykę doboru, wyjaśnia, dlaczego jak zainstalowana jest twoja pamięć liczy się tak samo jak ile jej masz, i pokazuje, które rozbudowy się opłacają.

Co RAM faktycznie robi w lokalnym AI

Trzy zadania. Po pierwsze, na maszynach tylko z CPU cały model musi zmieścić się w RAM — nie ma VRAM, w którym można się schować. Po drugie, na maszynach z GPU RAM jest pulą przelewową: llama.cpp i Ollama dzielą modele między VRAM a RAM, więc karta 6 GB plus 32 GB RAM uruchamia modele, których sama karta nigdy by nie mogła. Po trzecie, kontekst (cache KV) rośnie z twoją rozmową i ląduje tam, gdzie żyje model — praca z długim kontekstem dokłada gigabajty ponad rozmiar modelu.

Tabela doboru

Przybliżona pamięć potrzebna tylko na wagi modelu przy kwantyzacji Q4_K_M (zobacz nasz przewodnik po kwantyzacji GGUF, by dowiedzieć się, co znaczy Q4) — dodaj 4–8 GB na Windowsa, przeglądarkę i kontekst:

Model sizeQ4 weightsComfortable on CPU with
3–4B~2–2.5 GB8 GB (16 GB realistically)
7–8B~4–5 GB16 GB
13–14B~8–9 GB16 GB tight, 32 GB comfortable
30–34B~18–20 GB32 GB tight, 64 GB comfortable
70B~40–43 GB64 GB only

Zatem praktyczne poziomy: 16 GB uruchamia koniki robocze 7–8B; 32 GB odblokowuje 13B komfortowo i 30B na styk; 64 GB to bilet wstępu do modeli klasy 70B na laptopie — wolno (mniej więcej 1–2 tok/s na CPU, które recenzujemy, szacunkowo), ale działają, co jest niezwykłe jak na maszynę za ~1600 zł, taką jak maksymalnie wyposażony Dell Latitude 5540.

Szybkość: przepustowość bije pojemność

Oto część, którą większość kupujących pomija. Szybkość inferencji na CPU jest ograniczona niemal całkowicie przez przepustowość pamięci — każdy generowany token czyta cały model z RAM. Konsekwencje:

  • Dual-channel nie jest opcjonalny. Jedna kość 16 GB daje ci połowę przepustowości 2×8 GB — i blisko połowy tokenów na sekundę. Kupując używany, zweryfikuj, że oba sloty są zajęte (HWiNFO → Memory → liczba kanałów); konfiguracje z jedną kością są częste w maszynach poleasingowych i po cichu okaleczają pracę z LLM.
  • DDR5 bije DDR4 widocznie. DDR5-4800 w ThinkPadzie T14 Gen 3 to duża część tego, czemu ogarnia 4–5 tok/s na 7B, gdzie starsze maszyny z DDR4-2666 ogarniają ~2,5–3.
  • Więcej RAM nie znaczy szybciej. 64 GB uruchamia większe modele niż 32 GB; nie uruchamia małych modeli ani trochę szybciej. Kupuj pojemność pod modele, których chcesz, kanały pod szybkość, której chcesz.

Na maszynach z GPU ta sama logika wyjaśnia zachowanie odciążania: każda warstwa, która przelewa się z VRAM do RAM, spada z ~450 GB/s (GDDR6) do ~50–75 GB/s (laptopowy DDR4/5). 13B podzielony 80/20 między kartę 6 GB a RAM wciąż działa dobrze; podziel go 50/50, a jesteś głównie ograniczony przez CPU. Dlatego tak dużo trąbimy o VRAM — ale to RAM decyduje, czy przelew w ogóle działa.

Ekonomia rozbudowy (lipiec 2026, szacunki — sprawdź bieżące ceny)

SO-DIMM DDR4 to najtańsza rozbudowa zdolności w tym hobby: mniej więcej 190–280 zł za 2×16 GB, 420–600 zł za 2×32 GB. DDR5 idzie wyżej (~560–790 zł za 2×32 GB). Na tym tle:

  • Dell Latitude 5540: do 64 GB — najtańsza znana nam ścieżka do modeli 70B: ~1400 zł laptop + ~510 zł RAM.
  • Legion 5 Gen 6/Gen 7: do 32–64 GB — łączy GPU 6–8 GB z głęboką pulą odciążania; najlepszy uniwersalny combo cenowy na stronie.
  • Precision 7560 / ThinkPad P15 Gen 2: cztery sloty, do 128 GB — przesada dla większości, bezcenne przy eksperymentach 70B obok 16 GB VRAM.
  • Ostrzeżenie: ThinkPad T14s Gen 4 i większość cienkich laptopów lutują swoją pamięć. Co kupisz, z tym zostaniesz — kup konfigurację 32 GB albo wcale.

Szybkie rekomendacje

  • Kupując poniżej ~1900 zł: priorytetyzuj dwa sloty RAM ponad niemal wszystko inne. 16 GB dual-channel dziś, 32–64 GB za 230–510 zł, gdy tylko uderzy ambicja.
  • Kupując laptop z GPU: minimum 16 GB RAM, 32 GB, jeśli w planach są modele 13B+. RAM powinien być ~2× twojego VRAM jako leniwa reguła kciuka.
  • Już go masz: sprawdź konfigurację kanałów dziś — zapełnienie pustego drugiego slotu to rozbudowa za ~120 zł na pięć minut, która może niemal podwoić twoje tok/s.

Podsumowanie

  • Wagi modelu Q4 potrzebują mniej więcej: 7B → 5 GB, 13B → 9 GB, 30B → 20 GB, 70B → 43 GB — plus 4–8 GB na system i kontekst. 16/32/64 GB to prawdziwe poziomy zdolności.
  • Szybkość inferencji na CPU = przepustowość pamięci: dual-channel mniej więcej podwaja tok/s względem jednej kości, a DDR5 widocznie bije DDR4.
  • Na maszynach z GPU RAM jest pulą odciążania — decyduje, czy modele większe niż twój VRAM w ogóle działają.
  • Rozbudowy SO-DIMM (~190–600 zł) to najlepszy wydatek na złotówkę w lokalnym AI; laptopy z wlutowaną pamięcią go tracą, więc dobierz je dobrze pierwszego dnia.
  • 64 GB w Latitude za ~1400 zł uruchamia modele 70B. Wolno. Ale je uruchamia.

Powiązane artykuły