Ejecuta un asistente de código con IA en un portátil usado: Copilot sin la nube (2026)
Un asistente de código local —autocompletado y chat que se ejecutan enteramente en tu propia máquina— es una de las cargas de IA más prácticas para un portátil usado: los modelos son pequeños, los requisitos de latencia son modestos y el argumento de privacidad es real. Esta guía cubre la pila de 2026, qué modelos caben en cada nivel de VRAM y dónde lo local pierde honestamente ante el Copilot en la nube.
¿Para qué molestarse, si Copilot existe?
Tres razones que sobreviven al contacto con la realidad. Privacidad y cumplimiento: tu código nunca sale de la máquina, decisivo para bases de código de clientes, acuerdos de confidencialidad, trabajo sanitario/fintech y cualquier negocio donde «pegamos el repositorio en una herramienta de la nube» sea una frase incómoda. Sin conexión: trenes, aviones, wifi de hotel inestable. Coste: 0 €/mes frente a suscripciones por puesto, en hardware que ya compraste para otro trabajo de IA.
Y una contrarrazón honesta: los modelos de frontera en la nube siguen siendo más listos con problemas grandes, desordenados y multiarchivo. Lo local gana en autocompletado y chat rutinario; la nube aún gana en «refactoriza todo este módulo». La mayoría de quienes pasan a local acaban en híbrido.
La pila: Ollama + Continue
El valor por defecto de 2026 es aburrido y bueno: Ollama sirve los modelos en local; Continue (extensión de código abierto para VS Code/JetBrains) los conecta a tu editor con dos roles: un modelo pequeño y rápido para autocompletado en la pestaña y uno más grande para chat/edición. Existen alternativas (LM Studio como servidor, Cody, Twinny), pero Ollama+Continue tiene la mayor documentación y la menor fricción.
La división en dos modelos importa porque las tareas difieren. El autocompletado necesita el primer token en bastante menos de medio segundo: eso significa un modelo de 1,5–3B, siempre cargado. El chat tolera un segundo o dos de reflexión: ahí va tu presupuesto de VRAM.
Modelos por nivel de VRAM (2026)
La familia de código Qwen sigue siendo la líder de referencia en local en todos los niveles; Codestral, DeepSeek-Coder y Devstral son alternativas creíbles. Ajusta el modelo a tu tarjeta, recordando que la caché KV añade 1–4 GB por encima de la descarga a tamaños de contexto de trabajo:
| Tu hardware | Modelo de autocompletado | Modelo de chat | Experiencia |
|---|---|---|---|
| Solo CPU, 16 GB de RAM (T14 Gen 3) | Qwen2.5-Coder 1.5B | 7B Q4, ~4–5 tok/s | Autocompletado correcto; chat para ratos con paciencia |
| 4 GB de VRAM (P14s Gen 2, XPS 15) | 1.5B en GPU | 7B Q4 con descarga parcial, ~10–18 tok/s | Autocompletado ágil; chat usable |
| 6 GB (Legion 5 Gen 6) | 1.5–3B | Qwen2.5-Coder 7B Q4 entera en GPU, ~30 tok/s | El punto dulce económico |
| 8 GB (Legion 5 Gen 7, ZBook Fury G8) | 3B | 7B Q8 o 14B Q4 (justo), ~20–35 tok/s | Un uso diario realmente agradable |
| 16 GB (P15 Gen 2, Legion 7, Precision 7560) | 3B | Qwen coder 14B Q4 con holgura; clase 20B+ con espacio para contexto | Lo más cercano a la calidad de la nube en local |
(Las cifras de tok/s son estimaciones de benchmarks comparables de la comunidad; tu cuantización, longitud de contexto y configuración de RAM las mueven todas.)
Regla general para las expectativas de calidad: los modelos de código de 7B son fuertes en completados, código repetitivo, tests y explicar código; los de 14B o más añaden un razonamiento multipaso y una coherencia de edición notablemente mejores; nada local iguala a los modelos de frontera en la nube en refactorizaciones espinosas entre archivos, ver los límites honestos más abajo.
Configuración en cinco minutos
- Instala Ollama (la compilación de Windows va bien, ver Windows vs Linux; esta carga no necesita WSL2).
ollama pull qwen2.5-coder:1.5byollama pull qwen2.5-coder:7b(cambia los tamaños según la tabla).- Instala Continue en VS Code; en su configuración, apunta el rol de autocompletado al 1.5B y los roles de chat/edición al 7B en
http://localhost:11434. - Fija
maxPromptTokensdel autocompletado modestamente (~1–2k): los prompts largos son lo que hace que el autocompletado local se sienta lento. - Prueba: teclea una firma de función, espera al texto fantasma gris; selecciona un bloque y pide al chat que lo explique.
Si los completados se atascan, comprueba que Ollama mantuvo ambos modelos cargados (ollama ps): el intercambio de modelos en cada pulsación es la mala configuración clásica en tarjetas de 6 GB. Mantén el modelo de autocompletado lo bastante pequeño para que ambos quepan a la vez.
Limitaciones honestas
Los asistentes locales en 2026 son excelentes herramientas de línea y función y arquitectos mediocres. Las ventanas de contexto se configuran pequeñas por velocidad, así que la conciencia de todo el repositorio es superficial; las ediciones agénticas multiarchivo funcionan pero con más supervisión que las herramientas de la nube; y en un portátil con batería, la inferencia constante te cuesta aproximadamente una hora de autonomía: enchúfalo para sesiones largas (los térmicos también importan). El patrón pragmático para usuarios de empresa: local para el 90 % de los completados diarios y las preguntas rápidas (privacidad preservada, latencia estupenda), y un modelo en la nube invocado deliberadamente para el 10 % difícil.
Resumen
- Ollama + Continue en VS Code es la pila local estándar de 2026: un modelo de 1,5–3B para autocompletado instantáneo, un modelo de código de 7–14B para el chat.
- 6 GB de VRAM es donde programar en local se vuelve agradable (~30 tok/s en un 7B); 8–16 GB compran modelos de chat más listos, no un tecleo más rápido.
- Incluso un ThinkPad solo de CPU de 350 € ejecuta un autocompletado útil: los completados necesitan modelos pequeños, no GPU grandes.
- El argumento de privacidad es la característica estrella para la empresa: el código nunca sale de la máquina, y no hay factura por puesto.
- Quédate en híbrido: local para los completados diarios, nube para el razonamiento a escala de repositorio; fingir lo contrario decepciona en la primera semana.