Un assistente di coding AI locale su un laptop usato: Copilot senza il cloud (2026)
Un assistente di coding locale — autocompletamento e chat che girano interamente sulla tua macchina — è uno dei carichi AI più pratici per un laptop usato: i modelli sono piccoli, i requisiti di latenza sono modesti e il caso privacy è reale. Questa guida copre lo stack del 2026, quali modelli entrano in quale fascia di VRAM e dove il locale onestamente perde ancora contro Copilot cloud.
Perché preoccuparsene, se esiste Copilot?
Tre ragioni che sopravvivono all’impatto con la realtà. Privacy e conformità: il tuo codice non lascia mai la macchina — decisivo per le codebase dei clienti, gli NDA, il lavoro sanitario/fintech e qualsiasi azienda in cui “abbiamo incollato il repo in uno strumento cloud” è una frase imbarazzante. Offline: treni, aerei, Wi-Fi d’albergo ballerino. Costo: 0 €/mese contro gli abbonamenti per postazione, su hardware che hai già comprato per altro lavoro AI.
E una controragione onesta: i modelli cloud di frontiera restano più intelligenti sui problemi grandi, disordinati e multi-file. Il locale vince sull’autocompletamento e sulla chat di routine; il cloud vince ancora su “refactora tutto questo modulo”. La maggior parte di chi passa al locale finisce ibrida.
Lo stack: Ollama + Continue
Il default del 2026 è noioso e buono: Ollama serve i modelli in locale; Continue (estensione open-source per VS Code/JetBrains) li collega al tuo editor con due ruoli — un modello piccolo e veloce per l’autocompletamento e uno più grande per chat/modifiche. Esistono alternative (LM Studio come server, Cody, Twinny), ma Ollama+Continue ha più documentazione e meno attrito.
La divisione in due modelli conta perché i compiti differiscono. L’autocompletamento ha bisogno del primo token in ben meno di mezzo secondo — il che significa un modello da 1,5–3B, sempre caricato. La chat tollera un secondo o due di riflessione — è lì che va il tuo budget di VRAM.
Modelli per fascia di VRAM (2026)
La famiglia coder Qwen resta il leader di riferimento locale in tutte le fasce; Codestral, DeepSeek-Coder e Devstral sono alternative credibili. Abbina il modello alla tua scheda, ricordando che la KV cache aggiunge 1–4 GB sopra il download alle dimensioni di contesto di lavoro:
| Il tuo hardware | Modello autocomplete | Modello chat | Esperienza |
|---|---|---|---|
| Solo-CPU, 16 GB RAM (T14 Gen 3) | Qwen2.5-Coder 1.5B | 7B Q4, ~4–5 tok/s | Autocomplete OK; chat per i momenti pazienti |
| 4 GB VRAM (P14s Gen 2, XPS 15) | 1.5B su GPU | 7B Q4 con offload parziale, ~10–18 tok/s | Autocomplete scattante; chat usabile |
| 6 GB (Legion 5 Gen 6) | 1.5–3B | Qwen2.5-Coder 7B Q4 interamente su GPU, ~30 tok/s | Il punto ideale economico |
| 8 GB (Legion 5 Gen 7, ZBook Fury G8) | 3B | 7B Q8 o 14B Q4 (al limite), ~20–35 tok/s | Daily driver davvero piacevole |
| 16 GB (P15 Gen 2, Legion 7, Precision 7560) | 3B | Qwen coder 14B Q4 comodamente; classe 20B+ con spazio per il contesto | Il più vicino alla qualità cloud in locale |
(Le cifre in tok/s sono stime da benchmark comparabili della community; la tua quantizzazione, la lunghezza del contesto e la configurazione RAM le spostano tutte.)
Regola pratica per le aspettative di qualità: i modelli coder 7B sono forti su completamenti, boilerplate, test e spiegazione del codice; il 14B+ aggiunge un ragionamento multi-step e una coerenza nelle modifiche nettamente migliori; nulla di locale eguaglia i modelli cloud di frontiera sui refactoring cross-file più ostici — vedi i limiti onesti più sotto.
Setup in cinque minuti
- Installa Ollama (la build Windows va bene — vedi Windows vs Linux; questo carico non ha bisogno di WSL2).
ollama pull qwen2.5-coder:1.5beollama pull qwen2.5-coder:7b(cambia le dimensioni secondo la tabella).- Installa Continue in VS Code; nella sua config, punta il ruolo autocomplete sul 1.5B e i ruoli chat/edit sul 7B su
http://localhost:11434. - Imposta
maxPromptTokensdell’autocomplete in modo modesto (~1–2k) — i prompt lunghi sono ciò che fa sembrare lento il tab-complete locale. - Prova: digita la firma di una funzione, aspetta il testo fantasma grigio; evidenzia un blocco e chiedi alla chat di spiegarlo.
Se i completamenti si bloccano, controlla che Ollama abbia tenuto caricati entrambi i modelli (ollama ps) — lo scambio di modello a ogni battuta è la classica configurazione errata sulle schede da 6 GB. Tieni il modello di autocomplete abbastanza piccolo da farli entrare entrambi contemporaneamente.
Limiti onesti
Gli assistenti locali nel 2026 sono eccellenti strumenti di riga e funzione e mediocri architetti. Le finestre di contesto sono configurate piccole per la velocità, quindi la consapevolezza a livello di repo è superficiale; le modifiche agentiche multi-file funzionano ma con più accompagnamento degli strumenti cloud; e su un laptop a batteria, l’inferenza costante ti costa circa un’ora di autonomia — collega la rete per le sessioni lunghe (contano anche i termici). Il pattern pragmatico per gli utenti business: locale per il 90% dei completamenti quotidiani e delle domande veloci (privacy preservata, latenza ottima), un modello cloud invocato deliberatamente per il 10% difficile.
Riepilogo
- Ollama + Continue in VS Code è lo stack locale standard del 2026: un modello da 1,5–3B per l’autocompletamento istantaneo, un modello coder da 7–14B per la chat.
- 6 GB di VRAM è dove il coding locale diventa piacevole (~30 tok/s su un 7B); 8–16 GB comprano modelli di chat più intelligenti, non una digitazione più veloce.
- Anche un ThinkPad solo-CPU da ~370 € esegue un autocompletamento utile — i completamenti richiedono modelli piccoli, non GPU grandi.
- Il caso privacy è la killer feature per il business: il codice non lascia mai la macchina, e non c’è fattura per postazione.
- Resta ibrido: locale per i completamenti quotidiani, cloud per il ragionamento su scala repo — fingere il contrario delude alla prima settimana.