← Guides

Faire tourner un assistant de code IA local sur un portable d'occasion : Copilot sans le cloud (2026)

Un assistant de code local — autocomplétion et chat qui tournent entièrement sur votre propre machine — est l’une des charges IA les plus pratiques pour un portable d’occasion : les modèles sont petits, les exigences de latence modestes, et l’argument de la confidentialité est réel. Ce guide couvre la pile 2026, quels modèles tiennent dans quel palier de VRAM, et où le local perd honnêtement encore face au Copilot cloud.

Pourquoi se donner cette peine, puisque Copilot existe ?

Trois raisons qui survivent au contact du réel. Confidentialité et conformité : votre code ne quitte jamais la machine — décisif pour les bases de code clients, les NDA, le travail santé/fintech, et toute entreprise où « on a collé le dépôt dans un outil cloud » est une phrase gênante. Hors ligne : trains, avions, Wi-Fi d’hôtel capricieux. Coût : 0 €/mois contre des abonnements par siège, sur du matériel déjà acheté pour d’autres travaux IA.

Et une contre-raison honnête : les modèles cloud de pointe restent plus intelligents sur les gros problèmes désordonnés et multi-fichiers. Le local gagne sur l’autocomplétion et le chat de routine ; le cloud gagne encore sur « refactorise tout ce module ». La plupart de ceux qui passent au local finissent hybrides.

La pile : Ollama + Continue

Le choix par défaut de 2026 est ennuyeux et bon : Ollama sert les modèles en local ; Continue (extension open-source VS Code/JetBrains) les câble dans votre éditeur avec deux rôles — un petit modèle rapide pour l’autocomplétion et un plus gros pour le chat/l’édition. Des alternatives existent (LM Studio comme serveur, Cody, Twinny), mais Ollama+Continue a le plus de documentation et le moins de friction.

La séparation en deux modèles compte parce que les tâches diffèrent. L’autocomplétion a besoin du premier token en bien moins d’une demi-seconde — c’est-à-dire un modèle 1,5–3B, toujours chargé. Le chat tolère une seconde ou deux de réflexion — c’est là que va votre budget de VRAM.

Modèles par palier de VRAM (2026)

La famille de codeurs Qwen reste le leader de référence en local sur tous les paliers ; Codestral, DeepSeek-Coder et Devstral sont des alternatives crédibles. Adaptez le modèle à votre carte, en vous rappelant que le cache KV ajoute 1–4 GB par-dessus le téléchargement aux tailles de contexte de travail :

Votre matérielModèle d’autocomplétionModèle de chatExpérience
CPU seul, 16 GB RAM (T14 Gen 3)Qwen2.5-Coder 1.5B7B Q4, ~4–5 tok/sAutocomplétion OK ; chat pour les moments patients
4 GB VRAM (P14s Gen 2, XPS 15)1.5B sur GPU7B Q4 partiellement déporté, ~10–18 tok/sAutocomplétion vive ; chat utilisable
6 GB (Legion 5 Gen 6)1.5–3BQwen2.5-Coder 7B Q4 entièrement sur GPU, ~30 tok/sLe bon compromis budget
8 GB (Legion 5 Gen 7, ZBook Fury G8)3B7B Q8 ou 14B Q4 (serré), ~20–35 tok/sVraiment agréable au quotidien
16 GB (P15 Gen 2, Legion 7, Precision 7560)3BQwen coder 14B Q4 confortablement ; classe 20B+ avec de la place pour le contexteAu plus près de la qualité cloud en local

(Les chiffres de tok/s sont des estimations issues de benchmarks communautaires comparables ; votre quantisation, votre longueur de contexte et votre configuration RAM les font tous bouger.)

Règle empirique pour les attentes de qualité : les modèles codeurs 7B sont forts en complétions, code standard, tests et explication de code ; le 14B+ ajoute un raisonnement multi-étapes et une cohérence d’édition nettement meilleurs ; rien en local n’égale les modèles cloud de pointe sur les refactorisations multi-fichiers épineuses — voyez les limites honnêtes ci-dessous.

Installation en cinq minutes

  1. Installez Ollama (le build Windows convient — voir Windows vs Linux ; cette charge ne réclame pas WSL2).
  2. ollama pull qwen2.5-coder:1.5b et ollama pull qwen2.5-coder:7b (adaptez les tailles au tableau).
  3. Installez Continue dans VS Code ; dans sa config, pointez le rôle autocomplete sur le 1.5B et les rôles chat/edit sur le 7B à http://localhost:11434.
  4. Réglez le maxPromptTokens de l’autocomplétion modestement (~1–2k) — les prompts longs sont ce qui rend l’autocomplétion locale poussive.
  5. Testez : tapez une signature de fonction, attendez le texte fantôme gris ; surlignez un bloc et demandez au chat de l’expliquer.

Si les complétions calent, vérifiez qu’Ollama a gardé les deux modèles chargés (ollama ps) — l’échange de modèles à chaque frappe est la mauvaise config classique sur les cartes 6 GB. Gardez le modèle d’autocomplétion assez petit pour que les deux tiennent simultanément.

Limites honnêtes

Les assistants locaux en 2026 sont d’excellents outils de ligne et de fonction et des architectes médiocres. Les fenêtres de contexte sont configurées petites pour la vitesse, si bien que la conscience à l’échelle du dépôt est superficielle ; les éditions agentiques multi-fichiers fonctionnent mais avec plus de surveillance que les outils cloud ; et sur un portable sur batterie, l’inférence constante vous coûte environ une heure d’autonomie — branchez-vous pour les longues sessions (la thermique compte aussi). Le schéma pragmatique pour les utilisateurs professionnels : local pour les 90 % de complétions quotidiennes et de questions rapides (confidentialité préservée, latence excellente), un modèle cloud délibérément invoqué pour les 10 % difficiles.

Résumé

  • Ollama + Continue dans VS Code est la pile locale standard de 2026 : un modèle 1,5–3B pour l’autocomplétion instantanée, un modèle codeur 7–14B pour le chat.
  • 6 GB de VRAM, c’est là où le code local devient agréable (~30 tok/s sur un 7B) ; 8–16 GB achètent des modèles de chat plus intelligents, pas une frappe plus rapide.
  • Même un ThinkPad CPU seul à 375 € fait tourner une autocomplétion utile — les complétions réclament de petits modèles, pas de gros GPU.
  • L’argument de la confidentialité est la fonctionnalité phare pour les entreprises : le code ne quitte jamais la machine, et il n’y a pas de facture par siège.
  • Restez hybride : local pour les complétions quotidiennes, cloud pour le raisonnement à l’échelle du dépôt — prétendre le contraire déçoit dès la première semaine.

Articles connexes