Quanta RAM serve per gli LLM locali? 16 vs 32 vs 64 GB spiegati
La VRAM si prende tutta l’attenzione, ma la RAM di sistema decide in sordina cosa il tuo laptop può far girare — specialmente sulle macchine con grafica integrata che dominano il mercato sotto i 525 €. Questa guida ti dà i conti per il dimensionamento, spiega perché come è installata la tua RAM conta quanto quanta ne hai, e mostra quali upgrade convengono.
Cosa fa davvero la RAM nell’AI locale
Tre compiti. Primo, sulle macchine solo-CPU l’intero modello deve entrare in RAM — non c’è VRAM in cui nascondersi. Secondo, sulle macchine con GPU la RAM è la riserva di overflow: llama.cpp e Ollama dividono i modelli tra VRAM e RAM, così una scheda da 6 GB più 32 GB di RAM fa girare modelli che la sola scheda non potrebbe mai. Terzo, il contesto (la KV cache) cresce con la conversazione e finisce dove vive il modello — il lavoro a contesto lungo aggiunge gigabyte sopra la dimensione del modello.
La tabella di dimensionamento
Memoria approssimativa necessaria solo per i pesi del modello a quantizzazione Q4_K_M (vedi la nostra guida alla quantizzazione GGUF per cosa significa Q4) — aggiungi 4–8 GB per Windows, il browser e il contesto:
| Dimensione modello | Pesi Q4 | Comodo su CPU con |
|---|---|---|
| 3–4B | ~2–2.5 GB | 8 GB (16 GB realisticamente) |
| 7–8B | ~4–5 GB | 16 GB |
| 13–14B | ~8–9 GB | 16 GB al limite, 32 GB comodo |
| 30–34B | ~18–20 GB | 32 GB al limite, 64 GB comodo |
| 70B | ~40–43 GB | solo 64 GB |
Quindi le fasce pratiche: 16 GB fanno girare i cavalli di battaglia da 7–8B; 32 GB sbloccano il 13B comodamente e il 30B a fatica; 64 GB sono il biglietto d’ingresso ai modelli di classe 70B su un laptop — lentamente (circa 1–2 tok/s sulle CPU che recensiamo, stimato), ma girano, il che è notevole per una macchina da 370 € come un Dell Latitude 5540 al massimo.
Velocità: la banda batte la capacità
Ecco la parte che la maggior parte degli acquirenti manca. La velocità di inferenza su CPU è limitata quasi interamente dalla banda di memoria — ogni token generato legge l’intero modello dalla RAM. Conseguenze:
- Il dual-channel non è opzionale. Un modulo da 16 GB ti dà metà della banda di 2×8 GB — e quasi metà dei token al secondo. Comprando usato, verifica che entrambi gli slot siano popolati (HWiNFO → Memory → numero di canali); le config a singolo modulo sono comuni nelle macchine ex-lease e azzoppano silenziosamente il lavoro LLM.
- La DDR5 batte la DDR4 in modo visibile. La DDR5-4800 in un ThinkPad T14 Gen 3 è gran parte del motivo per cui gestisce 4–5 tok/s su un 7B dove le vecchie macchine DDR4-2666 gestiscono ~2,5–3.
- Più RAM non significa più veloce. 64 GB fanno girare modelli più grandi di 32 GB; non fanno girare i piccoli modelli più in fretta. Compra capacità per i modelli che vuoi, canali per la velocità che vuoi.
Sulle macchine con GPU la stessa logica spiega il comportamento dell’offloading: ogni layer che trabocca dalla VRAM alla RAM passa da ~450 GB/s (GDDR6) a ~50–75 GB/s (DDR4/5 da laptop). Un 13B diviso 80/20 tra una scheda da 6 GB e la RAM va comunque bene; dividilo 50/50 e sei per lo più CPU-bound. È per questo che insistiamo tanto sulla VRAM — ma è la RAM a decidere se l’overflow funziona affatto.
Economia degli upgrade (luglio 2026, stime — controlla i prezzi correnti)
Le SO-DIMM DDR4 sono l’upgrade di capacità più economico di questo hobby: circa 45–65 € per 2×16 GB, 95–135 € per 2×32 GB. La DDR5 costa di più (~125–180 € per 2×32 GB). A fronte di ciò:
- Dell Latitude 5540: a 64 GB — il percorso più economico verso il 70B che conosciamo: ~300 € di laptop + ~115 € di RAM.
- Legion 5 Gen 6/Gen 7: a 32–64 GB — abbina una GPU da 6–8 GB a una profonda riserva di offload; il miglior mix di valore complessivo del sito.
- Precision 7560 / ThinkPad P15 Gen 2: quattro slot, fino a 128 GB — eccessivo per i più, impagabile per gli esperimenti 70B accanto a 16 GB di VRAM.
- L’avvertimento: il ThinkPad T14s Gen 4 e la maggior parte dei thin-and-light saldano la RAM. Quello che compri è quello che ti tieni — compra la config da 32 GB o niente.
Raccomandazioni rapide
- Acquisto sotto i 420 €: dai priorità ai due slot RAM su quasi tutto il resto. 16 GB dual-channel oggi, 32–64 GB per 55–115 € quando l’ambizione colpisce.
- Acquisto di un laptop con GPU: 16 GB di RAM minimo, 32 GB se il piano sono modelli 13B+. La RAM dovrebbe essere ~2× la tua VRAM come regola pigra.
- Ce l’hai già: controlla oggi la config dei canali — popolare un secondo slot vuoto è un upgrade da ~25 € e cinque minuti che può quasi raddoppiare i tuoi tok/s.
Riepilogo
- I pesi dei modelli Q4 richiedono circa: 7B → 5 GB, 13B → 9 GB, 30B → 20 GB, 70B → 43 GB — più 4–8 GB per il sistema operativo e il contesto. 16/32/64 GB sono le vere fasce di capacità.
- Velocità di inferenza su CPU = banda di memoria: il dual-channel raddoppia grosso modo i tok/s rispetto a un singolo modulo, e la DDR5 batte visibilmente la DDR4.
- Sulle macchine con GPU, la RAM è la riserva di offload — decide se i modelli più grandi della tua VRAM girano affatto.
- Gli upgrade SO-DIMM (~45–135 €) sono la migliore spesa per capacità-per-euro nell’AI locale; i laptop con RAM saldata vi rinunciano, quindi scegline bene la config al primo giorno.
- 64 GB in un Latitude da 300 € fanno girare modelli 70B. Lentamente. Ma li fanno girare.