Fine-tuning di LLM su un laptop usato: cosa consente davvero la tua VRAM (2026)
Si può fare fine-tuning di un modello linguistico su un laptop usato? Sì — entro limiti di VRAM rigidi e prevedibili che questa guida illustra. Vedremo cosa richiedono davvero LoRA e QLoRA, cosa può addestrare ogni fascia di VRAM, i tempi reali all’orologio e il punto onesto in cui una GPU cloud a noleggio batte il tuo laptop.
Il fine-tuning completo è fuori discussione — e va bene così
Il fine-tuning completo aggiorna ogni peso del modello. Per un modello da 7B in bf16 significa circa 14 GB per i pesi, altri ~28 GB per gli stati dell’ottimizzatore, più gradienti e attivazioni — comodamente oltre 60 GB di VRAM. Nessun laptop è all’altezza, usato o nuovo.
Ciò che i laptop possono fare è il fine-tuning efficiente nei parametri. LoRA congela il modello base e addestra piccole matrici adapter (tipicamente <1% dei parametri). QLoRA va oltre: il modello base congelato viene quantizzato a 4-bit, così il maggior consumatore di memoria si riduce di ~75%, mentre gli adapter continuano ad addestrarsi in alta precisione. La perdita di qualità rispetto al fine-tuning completo è piccola per la maggior parte dei compiti di instruction-tuning e adattamento di stile — QLoRA è il modo in cui avviene praticamente tutto il fine-tuning su laptop e da hobbista.
I conti della VRAM
VRAM approssimativa necessaria per QLoRA con batch size 1, sequence length 1024, gradient checkpointing attivo, usando un trainer moderno (le cifre sono stime — dataset, sequence length e rank le spostano tutti):
| Modello base | Pesi 4-bit | Footprint QLoRA totale | Scheda minima realistica |
|---|---|---|---|
| 3B | ~1.8 GB | ~4–5 GB | 6 GB |
| 7–8B | ~4–4.5 GB | ~6–8 GB | 8 GB (6 GB possibile, al limite) |
| 13–14B | ~7–8 GB | ~10–13 GB | 16 GB |
| 32B+ | ~18 GB+ | oltre 20 GB | nessun laptop — territorio cloud |
La sequence length è il killer silenzioso: raddoppiare il contesto raddoppia grosso modo la memoria delle attivazioni. Se i tuoi esempi di addestramento sono documenti lunghi anziché brevi coppie di istruzioni, abbassa di una fascia le tue aspettative.
Unsloth, il trainer efficiente di fatto standard, taglia l’uso di VRAM di un ulteriore ~30–50% e addestra ~2× più velocemente del PEFT vanilla — è la differenza tra “13B entra in 16 GB” al limite e comodamente. Gira su Linux o WSL2, non su Windows nativo.
Cosa può addestrare ogni fascia di laptop
6 GB di VRAM (RTX 3060 — Legion 5 Gen 6, ZBook Studio G8): modelli da 3B comodamente, 7B al limite con Unsloth, sequenze brevi e pazienza. Una vera piattaforma di apprendimento, non di produzione.
8 GB di VRAM (RTX 3070 Ti / RTX A4000 — Legion 5 Gen 7, ZBook Fury G8): il punto d’ingresso pratico. QLoRA 7–8B funziona in modo affidabile; questa fascia copre il compito reale più comune — insegnare a un piccolo modello il tono, il formato o la terminologia del tuo dominio.
16 GB di VRAM (ThinkPad P15 Gen 2, Legion 7 Gen 6, Precision 7560): territorio QLoRA 13–14B, più 7B con sequenze più lunghe o batch più grandi. È la fascia più alta in cui “fallo in fine-tuning sul mio laptop” è un default sensato anziché un numero da circo.
Tempi di addestramento realistici
Tempo all’orologio stimato per un tipico piccolo job — 1.000 esempi di istruzioni, 3 epoche, QLoRA 7B con Unsloth:
- RTX 3060 6 GB: ~4–8 ore (se entra alla tua sequence length)
- RTX 3070 Ti / A4000 8 GB: ~2,5–5 ore
- RTX 3080 16 GB / A5000 16 GB: ~1,5–3 ore
Un 13B nella fascia da 16 GB raddoppia grosso modo quei numeri. Sono lavori notturni, non pause caffè — ed è per questo che i termici contano: i telai da gaming e workstation che mantengono i clock per ore (vedi le nostre note termiche per ogni recensione) finiscono molto prima delle macchine sottili che throttlano.
Quando il cloud batte il tuo laptop
Noleggiare una RTX 4090 o una A100 all’ora costa poco, e per alcuni job è semplicemente la scelta giusta. Regole pratiche:
- Fai fine-tuning in locale quando: il modello è ≤13B, i dati sono privati o regolamentati, iteri di frequente su piccoli run, o possiedi già la macchina da 8–16 GB.
- Noleggia quando: il modello è da 30B+, un singolo run supera ~12 ore-laptop, ti servono più esperimenti in parallelo, o la scadenza è domani. Pochi euro comprano tipicamente più potenza di calcolo di quanta il tuo laptop ne offra in una notte.
Il pattern ibrido funziona meglio: prototipa dataset e iperparametri in locale su un 7B, poi noleggia una grande GPU per il run finale 13B/30B.
Prima ancora di fare fine-tuning: prova RAG e il prompting
Il fine-tuning insegna il comportamento — tono, formato, stile di dominio. È uno strumento scadente per iniettare fatti, che il retrieval (RAG) gestisce meglio e in modo più aggiornabile. Se il tuo obiettivo è “far rispondere il modello dai miei documenti”, costruisci prima il RAG; fai fine-tuning solo quando il problema è lo stile dell’output o il formato del compito. Molti progetti “ci serve il fine-tuning” finiscono con un buon system prompt.
Riepilogo
- Il fine-tuning completo richiede oltre 60 GB di VRAM — i laptop fanno QLoRA, che va bene per la maggior parte dei compiti reali.
- Fasce di VRAM: 6 GB = 3B (7B al limite), 8 GB = 7–8B in modo affidabile, 16 GB = 13–14B. Usa Unsloth.
- Un run QLoRA 7B su 1k esempi è un lavoro da 1,5–8 ore secondo la GPU — notturno, non istantaneo.
- Dati privati e iterazioni piccole e frequenti favoriscono il locale; modelli da 30B+ e scadenze favoriscono il noleggio di una GPU cloud.
- Vuoi fatti, non stile? Costruisci il RAG prima di fare fine-tuning di qualsiasi cosa.