Combien de RAM pour les LLM locaux ? 16 vs 32 vs 64 GB expliqués
La VRAM attire toute l’attention, mais la RAM système décide discrètement de ce que votre portable peut faire tourner tout court — surtout sur les machines à graphismes intégrés qui dominent le marché à moins de 500 €. Ce guide vous donne le calcul de dimensionnement, explique pourquoi la manière dont votre RAM est installée compte autant que la quantité, et montre quelles mises à niveau paient.
Ce que la RAM fait réellement en IA locale
Trois rôles. D’abord, sur les machines CPU seul, le modèle entier doit tenir en RAM — il n’y a pas de VRAM où se cacher. Ensuite, sur les machines GPU, la RAM est le réservoir de débordement : llama.cpp et Ollama répartissent les modèles entre VRAM et RAM, si bien qu’une carte 6 GB plus 32 GB de RAM fait tourner des modèles que la carte seule n’aurait jamais pu. Enfin, le contexte (le cache KV) grandit avec votre conversation et atterrit là où vit le modèle — le travail à long contexte ajoute des gigaoctets par-dessus la taille du modèle.
Le tableau de dimensionnement
Mémoire approximative nécessaire juste pour les poids du modèle en quantisation Q4_K_M (voir notre guide de quantisation GGUF pour ce que Q4 signifie) — ajoutez 4–8 GB pour Windows, votre navigateur et le contexte :
| Taille du modèle | Poids Q4 | Confortable sur CPU avec |
|---|---|---|
| 3–4B | ~2–2,5 GB | 8 GB (16 GB réalistement) |
| 7–8B | ~4–5 GB | 16 GB |
| 13–14B | ~8–9 GB | 16 GB juste, 32 GB confortable |
| 30–34B | ~18–20 GB | 32 GB juste, 64 GB confortable |
| 70B | ~40–43 GB | 64 GB uniquement |
Donc les paliers pratiques : 16 GB font tourner les chevaux de bataille 7–8B ; 32 GB débloquent le 13B confortablement et le 30B à la limite ; 64 GB sont le ticket d’entrée pour les modèles de classe 70B sur un portable — lentement (environ 1–2 tok/s sur les CPU que nous testons, estimé), mais ils tournent, ce qui est remarquable pour une machine à 375 € comme un Dell Latitude 5540 poussé au maximum.
Vitesse : la bande passante bat la capacité
Voici la partie que la plupart des acheteurs ratent. La vitesse d’inférence CPU est limitée presque entièrement par la bande passante mémoire — chaque token généré lit tout le modèle depuis la RAM. Conséquences :
- Le double canal n’est pas optionnel. Une barrette 16 GB vous donne la moitié de la bande passante de 2×8 GB — et près de la moitié des tokens par seconde. À l’achat d’occasion, vérifiez que les deux emplacements sont peuplés (HWiNFO → Memory → nombre de canaux) ; les configs à une seule barrette sont courantes dans les machines de parc et handicapent silencieusement le travail LLM.
- La DDR5 bat la DDR4 visiblement. La DDR5-4800 d’un ThinkPad T14 Gen 3 explique en grande partie pourquoi il atteint 4–5 tok/s sur un 7B là où d’anciennes machines DDR4-2666 atteignent ~2,5–3.
- Plus de RAM ne veut pas dire plus rapide. 64 GB font tourner de plus gros modèles que 32 GB ; ils ne font pas tourner les petits modèles plus vite. Achetez de la capacité pour les modèles voulus, des canaux pour la vitesse voulue.
Sur les machines GPU, la même logique explique le comportement de déport : chaque couche qui déborde de la VRAM vers la RAM passe de ~450 GB/s (GDDR6) à ~50–75 GB/s (DDR4/5 de portable). Un 13B réparti 80/20 entre une carte 6 GB et la RAM reste agréable ; répartissez-le 50/50 et vous êtes surtout limité par le CPU. C’est pourquoi nous insistons tant sur la VRAM — mais la RAM décide si le débordement fonctionne tout court.
Économie des mises à niveau (juillet 2026, estimations — vérifiez les prix actuels)
La SO-DIMM DDR4 est la mise à niveau de capacité la moins chère de ce hobby : environ 45–65 € pour 2×16 GB, 95–140 € pour 2×32 GB. La DDR5 monte plus haut (~130–180 € pour 2×32 GB). En regard :
- Dell Latitude 5540 : vers 64 GB — la voie 70B la moins chère que nous connaissions : ~300 € de portable + ~120 € de RAM.
- Legion 5 Gen 6/Gen 7 : vers 32–64 GB — associe un GPU 6–8 GB à un profond réservoir de déport ; le meilleur combo polyvalent du site.
- Precision 7560 / ThinkPad P15 Gen 2 : quatre emplacements, jusqu’à 128 GB — excessif pour la plupart, inestimable pour les expériences 70B aux côtés de 16 GB de VRAM.
- L’avertissement : le ThinkPad T14s Gen 4 et la plupart des ultraportables soudent leur RAM. Ce que vous achetez est ce que vous garderez à vie — prenez la config 32 GB ou rien.
Recommandations rapides
- Achat à moins de 400 € : priorisez deux emplacements RAM sur presque tout le reste. 16 GB en double canal aujourd’hui, 32–64 GB pour 55–120 € quand l’ambition frappe.
- Achat d’un portable GPU : 16 GB de RAM minimum, 32 GB si les modèles 13B+ sont au programme. La RAM devrait faire ~2× votre VRAM comme règle paresseuse.
- Vous le possédez déjà : vérifiez la config des canaux aujourd’hui — peupler un second emplacement vide est une mise à niveau de 25 €, cinq minutes, qui peut presque doubler vos tok/s.
Résumé
- Les poids de modèle Q4 réclament environ : 7B → 5 GB, 13B → 9 GB, 30B → 20 GB, 70B → 43 GB — plus 4–8 GB pour l’OS et le contexte. 16/32/64 GB sont les vrais paliers de capacité.
- Vitesse d’inférence CPU = bande passante mémoire : le double canal double à peu près les tok/s par rapport à une seule barrette, et la DDR5 bat visiblement la DDR4.
- Sur les machines GPU, la RAM est le réservoir de déport — elle décide si les modèles plus gros que votre VRAM tournent tout court.
- Les mises à niveau SO-DIMM (~45–140 €) sont la meilleure dépense capacité-par-euro en IA locale ; les portables à RAM soudée y renoncent, alors spécifiez-les bien dès le premier jour.
- 64 GB dans un Latitude à 320 € font tourner des modèles 70B. Lentement. Mais ils les font tourner.