Fine-tuning de LLM sur un portable d'occasion : ce que votre VRAM permet vraiment (2026)
Peut-on fine-tuner un modèle de langage sur un portable d’occasion ? Oui — dans des limites de VRAM strictes et prévisibles que ce guide détaille. Nous verrons ce dont LoRA et QLoRA ont réellement besoin, ce que chaque palier de VRAM peut entraîner, des temps réels réalistes, et le point honnête où un GPU cloud loué bat votre portable.
Le fine-tuning complet est hors de portée — et c’est très bien
Le fine-tuning complet met à jour chaque poids du modèle. Pour un modèle 7B en bf16, cela représente environ 14 GB pour les poids, encore ~28 GB pour les états de l’optimiseur, plus les gradients et activations — bien au-delà de 60 GB de VRAM. Aucun portable ne qualifie, d’occasion ou neuf.
Ce que les portables peuvent faire, c’est le fine-tuning à paramètres efficaces. LoRA gèle le modèle de base et entraîne de petites matrices d’adaptation (généralement <1 % des paramètres). QLoRA va plus loin : le modèle de base gelé est quantisé en 4 bits, si bien que le plus gros consommateur de mémoire fond d’environ 75 %, pendant que les adaptateurs s’entraînent toujours en haute précision. La perte de qualité par rapport au fine-tuning complet est faible pour la plupart des tâches d’instruction-tuning et d’adaptation de style — QLoRA est la manière dont se fait la quasi-totalité du fine-tuning sur portable et amateur.
Le calcul de la VRAM
VRAM approximative nécessaire pour QLoRA avec batch size 1, longueur de séquence 1024, gradient checkpointing activé, sur un trainer moderne (ces chiffres sont des estimations — le dataset, la longueur de séquence et le rang les font tous bouger) :
| Modèle de base | Poids 4 bits | Empreinte QLoRA totale | Carte minimale réaliste |
|---|---|---|---|
| 3B | ~1,8 GB | ~4–5 GB | 6 GB |
| 7–8B | ~4–4,5 GB | ~6–8 GB | 8 GB (6 GB possible, serré) |
| 13–14B | ~7–8 GB | ~10–13 GB | 16 GB |
| 32B+ | ~18 GB+ | plus de 20 GB | aucun portable — territoire cloud |
La longueur de séquence est le tueur silencieux : doubler le contexte double à peu près la mémoire d’activation. Si vos exemples d’entraînement sont de longs documents plutôt que de courtes paires d’instructions, descendez d’un palier dans vos attentes.
Unsloth, le trainer efficace devenu standard de fait, réduit l’usage de VRAM d’encore ~30–50 % et entraîne ~2× plus vite que le PEFT classique — c’est la différence entre « 13B tient sur 16 GB » marginal et confortable. Il tourne sur Linux ou WSL2, pas sur Windows natif.
Ce que chaque palier de portable peut entraîner
6 GB de VRAM (RTX 3060 — Legion 5 Gen 6, ZBook Studio G8) : des modèles 3B confortablement, du 7B à la limite avec Unsloth, des séquences courtes et de la patience. Une vraie plateforme d’apprentissage, pas de production.
8 GB de VRAM (RTX 3070 Ti / RTX A4000 — Legion 5 Gen 7, ZBook Fury G8) : le point d’entrée pratique. Le QLoRA 7–8B fonctionne de façon fiable ; ce palier couvre la tâche réelle la plus courante — apprendre à un petit modèle le ton, le format ou la terminologie de votre domaine.
16 GB de VRAM (ThinkPad P15 Gen 2, Legion 7 Gen 6, Precision 7560) : territoire du QLoRA 13–14B, plus du 7B avec des séquences plus longues ou de plus gros batchs. C’est le plus haut palier où « fine-tune-le sur mon portable » est un choix par défaut sensé plutôt qu’un tour de passe-passe.
Temps d’entraînement réalistes
Temps réel estimé pour un petit job typique — 1 000 exemples d’instruction, 3 époques, QLoRA 7B avec Unsloth :
- RTX 3060 6 GB : ~4–8 heures (si ça tient à votre longueur de séquence)
- RTX 3070 Ti / A4000 8 GB : ~2,5–5 heures
- RTX 3080 16 GB / A5000 16 GB : ~1,5–3 heures
Un 13B sur le palier 16 GB double à peu près ces chiffres. Ce sont des jobs de nuit, pas des pauses café — c’est pourquoi la thermique compte : les châssis gaming et station de travail qui tiennent leurs fréquences des heures durant (voir nos notes thermiques par test) finissent nettement plus vite que les machines fines qui throttlent.
Quand le cloud bat votre portable
Louer un RTX 4090 ou un A100 à l’heure coûte peu, et pour certains jobs c’est simplement le bon choix. Règles empiriques :
- Fine-tunez en local quand : le modèle est ≤13B, les données sont privées ou réglementées, vous itérez souvent sur de petits runs, ou vous possédez déjà la machine 8–16 GB.
- Louez quand : le modèle est 30B+, un seul run dépasse ~12 heures-portable, vous avez besoin de plusieurs expériences en parallèle, ou l’échéance est demain. Quelques euros achètent généralement plus de calcul que votre portable n’en délivre en une nuit.
Le schéma hybride marche le mieux : prototypez le dataset et les hyperparamètres en local sur un 7B, puis louez un gros GPU pour le run final 13B/30B.
Avant même de fine-tuner : essayez le RAG et le prompting
Le fine-tuning enseigne un comportement — ton, format, style de domaine. C’est un mauvais outil pour injecter des faits, que la recherche (RAG) gère mieux et de façon plus actualisable. Si votre objectif est « faire répondre le modèle à partir de mes documents », construisez d’abord un RAG ; ne fine-tunez que lorsque le style de sortie ou le format de tâche est le problème. Beaucoup de projets « il nous faut du fine-tuning » s’arrêtent à un bon prompt système.
Résumé
- Le fine-tuning complet réclame 60 GB+ de VRAM — les portables font du QLoRA, ce qui convient à la plupart des tâches réelles.
- Paliers de VRAM : 6 GB = 3B (7B à la limite), 8 GB = 7–8B de façon fiable, 16 GB = 13–14B. Utilisez Unsloth.
- Un run QLoRA 7B sur 1 000 exemples est un job de 1,5–8 heures selon votre GPU — de nuit, pas instantané.
- Données privées et petites itérations fréquentes favorisent le local ; les modèles 30B+ et les échéances favorisent la location d’un GPU cloud.
- Vous voulez des faits, pas du style ? Construisez un RAG avant de fine-tuner quoi que ce soit.