← Poradniki

Fine-tuning LLM na używanym laptopie: co naprawdę pozwala twój VRAM (2026)

Czy można dostroić model językowy na używanym laptopie? Tak — w ścisłych, przewidywalnych granicach VRAM, które ten przewodnik rozkłada na czynniki pierwsze. Omówimy, czego naprawdę potrzebują LoRA i QLoRA, co potrafi trenować każdy poziom VRAM, realne czasy zegarowe oraz uczciwy moment, w którym wynajęte GPU w chmurze bije twój laptop.

Pełny fine-tuning odpada — i to w porządku

Pełny fine-tuning aktualizuje każdą wagę w modelu. Dla modelu 7B w bf16 oznacza to mniej więcej 14 GB na wagi, kolejne ~28 GB na stany optymalizatora, plus gradienty i aktywacje — spokojnie ponad 60 GB VRAM. Żaden laptop się nie kwalifikuje, używany czy nowy.

To, co laptopy potrafią, to fine-tuning oszczędny parametrowo. LoRA zamraża model bazowy i trenuje małe macierze adapterów (zwykle <1% parametrów). QLoRA idzie dalej: zamrożony model bazowy jest kwantyzowany do 4 bitów, więc największy pożeracz pamięci kurczy się o ~75%, podczas gdy adaptery wciąż trenują się w wysokiej precyzji. Utrata jakości względem pełnego fine-tuningu jest niewielka dla większości zadań dostrajania instrukcji i adaptacji stylu — QLoRA to sposób, w jaki dzieje się praktycznie cały fine-tuning na laptopach i po godzinach.

Matematyka VRAM

Przybliżony VRAM potrzebny do QLoRA przy rozmiarze partii 1, długości sekwencji 1024, włączonym gradient checkpointingu, z użyciem nowoczesnego trenera (liczby są szacunkami — zbiór danych, długość sekwencji i rank przesuwają je wszystkie):

Base model4-bit weightsTotal QLoRA footprintMinimum realistic card
3B~1.8 GB~4–5 GB6 GB
7–8B~4–4.5 GB~6–8 GB8 GB (6 GB possible, tight)
13–14B~7–8 GB~10–13 GB16 GB
32B+~18 GB+over 20 GBno laptop — cloud territory

Długość sekwencji to cichy zabójca: podwojenie kontekstu mniej więcej podwaja pamięć aktywacji. Jeśli twoje przykłady treningowe to długie dokumenty, a nie krótkie pary instrukcji, obniż swoje oczekiwania o jeden poziom.

Unsloth, de facto standardowy oszczędny trener, tnie zużycie VRAM o mniej więcej dodatkowe 30–50% i trenuje ~2× szybciej niż zwykły PEFT — to różnica między tym, że „13B mieści się w 16 GB” jest na granicy, a jest komfortowe. Działa na Linuksie lub WSL2, a nie na natywnym Windowsie.

Co potrafi trenować każdy poziom laptopa

6 GB VRAM (RTX 3060 — Legion 5 Gen 6, ZBook Studio G8): modele 3B komfortowo, 7B na granicy z Unsloth, krótkie sekwencje i cierpliwość. Prawdziwa platforma do nauki, nie do produkcji.

8 GB VRAM (RTX 3070 Ti / RTX A4000 — Legion 5 Gen 7, ZBook Fury G8): praktyczny punkt wejścia. 7–8B QLoRA działa niezawodnie; ten poziom pokrywa najczęstsze realne zadanie — nauczenie małego modelu tonu, formatu lub terminologii twojej dziedziny.

16 GB VRAM (ThinkPad P15 Gen 2, Legion 7 Gen 6, Precision 7560): terytorium 13–14B QLoRA, plus 7B z dłuższymi sekwencjami lub większymi partiami. To najwyższy poziom, na którym „dostrój to na moim laptopie” jest sensownym domyślnym wyborem, a nie sztuczką na imprezie.

Realne czasy treningu

Szacowany czas zegarowy dla typowego małego zadania — 1000 przykładów instrukcji, 3 epoki, 7B QLoRA z Unsloth:

  • RTX 3060 6 GB: ~4–8 godzin (jeśli zmieści się przy twojej długości sekwencji)
  • RTX 3070 Ti / A4000 8 GB: ~2,5–5 godzin
  • RTX 3080 16 GB / A5000 16 GB: ~1,5–3 godzin

Model 13B na poziomie 16 GB mniej więcej podwaja te liczby. To zadania na noc, a nie na przerwę na kawę — dlatego termika ma znaczenie: obudowy gamingowe i stacji roboczych, które utrzymują taktowanie godzinami (zobacz nasze notatki termiczne w recenzjach), kończą znacząco szybciej niż cienkie maszyny, które się dławią.

Kiedy chmura bije twój laptop

Wynajem RTX 4090 lub A100 na godziny kosztuje niewiele, a dla niektórych zadań to po prostu właściwy wybór. Reguły kciuka:

  • Dostrajaj lokalnie, gdy: model ma ≤13B, dane są prywatne lub regulowane, iterujesz często na małych przebiegach albo masz już maszynę 8–16 GB.
  • Wynajmuj, gdy: model ma 30B+, pojedynczy przebieg przekracza ~12 godzin na laptopie, potrzebujesz kilku eksperymentów równolegle albo termin jest na jutro. Kilkadziesiąt złotych zwykle kupuje więcej mocy obliczeniowej, niż twój laptop dostarczy przez noc.

Najlepiej sprawdza się wzorzec hybrydowy: prototypuj zbiór danych i hiperparametry lokalnie na 7B, a potem wynajmij jedno duże GPU do finalnego przebiegu 13B/30B.

Zanim w ogóle zaczniesz fine-tuning: wypróbuj RAG i prompting

Fine-tuning uczy zachowania — tonu, formatu, stylu dziedziny. To słabe narzędzie do wstrzykiwania faktów, które wyszukiwanie (RAG) obsługuje lepiej i z możliwością aktualizacji. Jeśli twoim celem jest „spraw, by model odpowiadał na podstawie moich dokumentów”, najpierw zbuduj RAG; dostrajaj tylko wtedy, gdy problemem jest styl wyjścia lub format zadania. Wiele projektów „potrzebujemy fine-tuningu” kończy się na dobrym prompcie systemowym.

Podsumowanie

  • Pełny fine-tuning potrzebuje 60 GB+ VRAM — laptopy robią QLoRA, co wystarcza do większości realnych zadań.
  • Poziomy VRAM: 6 GB = 3B (7B na granicy), 8 GB = 7–8B niezawodnie, 16 GB = 13–14B. Używaj Unsloth.
  • Przebieg 7B QLoRA na 1 tys. przykładów to zadanie na 1,5–8 godzin zależnie od GPU — na noc, nie natychmiast.
  • Dane prywatne i częste małe iteracje sprzyjają lokalnemu; modele 30B+ i terminy sprzyjają wynajmowi GPU w chmurze.
  • Chcesz faktów, nie stylu? Zbuduj RAG, zanim cokolwiek dostroisz.

Powiązane artykuły