← Guías

Ejecuta un asistente de código con IA en un portátil usado: Copilot sin la nube (2026)

Un asistente de código local —autocompletado y chat que se ejecutan enteramente en tu propia máquina— es una de las cargas de IA más prácticas para un portátil usado: los modelos son pequeños, los requisitos de latencia son modestos y el argumento de privacidad es real. Esta guía cubre la pila de 2026, qué modelos caben en cada nivel de VRAM y dónde lo local pierde honestamente ante el Copilot en la nube.

¿Para qué molestarse, si Copilot existe?

Tres razones que sobreviven al contacto con la realidad. Privacidad y cumplimiento: tu código nunca sale de la máquina, decisivo para bases de código de clientes, acuerdos de confidencialidad, trabajo sanitario/fintech y cualquier negocio donde «pegamos el repositorio en una herramienta de la nube» sea una frase incómoda. Sin conexión: trenes, aviones, wifi de hotel inestable. Coste: 0 €/mes frente a suscripciones por puesto, en hardware que ya compraste para otro trabajo de IA.

Y una contrarrazón honesta: los modelos de frontera en la nube siguen siendo más listos con problemas grandes, desordenados y multiarchivo. Lo local gana en autocompletado y chat rutinario; la nube aún gana en «refactoriza todo este módulo». La mayoría de quienes pasan a local acaban en híbrido.

La pila: Ollama + Continue

El valor por defecto de 2026 es aburrido y bueno: Ollama sirve los modelos en local; Continue (extensión de código abierto para VS Code/JetBrains) los conecta a tu editor con dos roles: un modelo pequeño y rápido para autocompletado en la pestaña y uno más grande para chat/edición. Existen alternativas (LM Studio como servidor, Cody, Twinny), pero Ollama+Continue tiene la mayor documentación y la menor fricción.

La división en dos modelos importa porque las tareas difieren. El autocompletado necesita el primer token en bastante menos de medio segundo: eso significa un modelo de 1,5–3B, siempre cargado. El chat tolera un segundo o dos de reflexión: ahí va tu presupuesto de VRAM.

Modelos por nivel de VRAM (2026)

La familia de código Qwen sigue siendo la líder de referencia en local en todos los niveles; Codestral, DeepSeek-Coder y Devstral son alternativas creíbles. Ajusta el modelo a tu tarjeta, recordando que la caché KV añade 1–4 GB por encima de la descarga a tamaños de contexto de trabajo:

Tu hardwareModelo de autocompletadoModelo de chatExperiencia
Solo CPU, 16 GB de RAM (T14 Gen 3)Qwen2.5-Coder 1.5B7B Q4, ~4–5 tok/sAutocompletado correcto; chat para ratos con paciencia
4 GB de VRAM (P14s Gen 2, XPS 15)1.5B en GPU7B Q4 con descarga parcial, ~10–18 tok/sAutocompletado ágil; chat usable
6 GB (Legion 5 Gen 6)1.5–3BQwen2.5-Coder 7B Q4 entera en GPU, ~30 tok/sEl punto dulce económico
8 GB (Legion 5 Gen 7, ZBook Fury G8)3B7B Q8 o 14B Q4 (justo), ~20–35 tok/sUn uso diario realmente agradable
16 GB (P15 Gen 2, Legion 7, Precision 7560)3BQwen coder 14B Q4 con holgura; clase 20B+ con espacio para contextoLo más cercano a la calidad de la nube en local

(Las cifras de tok/s son estimaciones de benchmarks comparables de la comunidad; tu cuantización, longitud de contexto y configuración de RAM las mueven todas.)

Regla general para las expectativas de calidad: los modelos de código de 7B son fuertes en completados, código repetitivo, tests y explicar código; los de 14B o más añaden un razonamiento multipaso y una coherencia de edición notablemente mejores; nada local iguala a los modelos de frontera en la nube en refactorizaciones espinosas entre archivos, ver los límites honestos más abajo.

Configuración en cinco minutos

  1. Instala Ollama (la compilación de Windows va bien, ver Windows vs Linux; esta carga no necesita WSL2).
  2. ollama pull qwen2.5-coder:1.5b y ollama pull qwen2.5-coder:7b (cambia los tamaños según la tabla).
  3. Instala Continue en VS Code; en su configuración, apunta el rol de autocompletado al 1.5B y los roles de chat/edición al 7B en http://localhost:11434.
  4. Fija maxPromptTokens del autocompletado modestamente (~1–2k): los prompts largos son lo que hace que el autocompletado local se sienta lento.
  5. Prueba: teclea una firma de función, espera al texto fantasma gris; selecciona un bloque y pide al chat que lo explique.

Si los completados se atascan, comprueba que Ollama mantuvo ambos modelos cargados (ollama ps): el intercambio de modelos en cada pulsación es la mala configuración clásica en tarjetas de 6 GB. Mantén el modelo de autocompletado lo bastante pequeño para que ambos quepan a la vez.

Limitaciones honestas

Los asistentes locales en 2026 son excelentes herramientas de línea y función y arquitectos mediocres. Las ventanas de contexto se configuran pequeñas por velocidad, así que la conciencia de todo el repositorio es superficial; las ediciones agénticas multiarchivo funcionan pero con más supervisión que las herramientas de la nube; y en un portátil con batería, la inferencia constante te cuesta aproximadamente una hora de autonomía: enchúfalo para sesiones largas (los térmicos también importan). El patrón pragmático para usuarios de empresa: local para el 90 % de los completados diarios y las preguntas rápidas (privacidad preservada, latencia estupenda), y un modelo en la nube invocado deliberadamente para el 10 % difícil.

Resumen

  • Ollama + Continue en VS Code es la pila local estándar de 2026: un modelo de 1,5–3B para autocompletado instantáneo, un modelo de código de 7–14B para el chat.
  • 6 GB de VRAM es donde programar en local se vuelve agradable (~30 tok/s en un 7B); 8–16 GB compran modelos de chat más listos, no un tecleo más rápido.
  • Incluso un ThinkPad solo de CPU de 350 € ejecuta un autocompletado útil: los completados necesitan modelos pequeños, no GPU grandes.
  • El argumento de privacidad es la característica estrella para la empresa: el código nunca sale de la máquina, y no hay factura por puesto.
  • Quédate en híbrido: local para los completados diarios, nube para el razonamiento a escala de repositorio; fingir lo contrario decepciona en la primera semana.

Artículos relacionados