← Guías

Ajuste fino de LLM en un portátil usado: qué permite realmente tu VRAM (2026)

¿Se puede hacer ajuste fino de un modelo de lenguaje en un portátil usado? Sí, dentro de unos límites de VRAM estrictos y predecibles que esta guía detalla. Cubriremos qué necesitan de verdad LoRA y QLoRA, qué puede entrenar cada nivel de VRAM, tiempos reales de reloj y el punto honesto en el que una GPU en la nube alquilada supera a tu portátil.

El ajuste fino completo queda descartado, y no pasa nada

El ajuste fino completo actualiza cada peso del modelo. Para un modelo de 7B en bf16 eso significa unos 14 GB para los pesos, otros ~28 GB para los estados del optimizador, más gradientes y activaciones: cómodamente por encima de 60 GB de VRAM. Ningún portátil cumple, ni usado ni nuevo.

Lo que los portátiles pueden hacer es ajuste fino eficiente en parámetros. LoRA congela el modelo base y entrena pequeñas matrices adaptadoras (normalmente <1 % de los parámetros). QLoRA va más allá: el modelo base congelado se cuantiza a 4 bits, de modo que el mayor consumidor de memoria se reduce en ~75 %, mientras los adaptadores siguen entrenándose en alta precisión. La pérdida de calidad frente al ajuste fino completo es pequeña para la mayoría de tareas de instruction-tuning y adaptación de estilo: QLoRA es como ocurre prácticamente todo el ajuste fino en portátiles y a nivel aficionado.

Las cuentas de la VRAM

VRAM aproximada necesaria para QLoRA con tamaño de lote 1, longitud de secuencia 1024, gradient checkpointing activado y un entrenador moderno (las cifras son estimaciones: el dataset, la longitud de secuencia y el rango las mueven todas):

Modelo basePesos en 4 bitsHuella total con QLoRATarjeta mínima realista
3B~1.8 GB~4–5 GB6 GB
7–8B~4–4.5 GB~6–8 GB8 GB (6 GB posible, justo)
13–14B~7–8 GB~10–13 GB16 GB
32B+~18 GB+más de 20 GBningún portátil — territorio de nube

La longitud de secuencia es el asesino silencioso: duplicar el contexto duplica más o menos la memoria de activaciones. Si tus ejemplos de entrenamiento son documentos largos y no pares cortos de instrucción, baja un nivel en tus expectativas.

Unsloth, el entrenador eficiente que es estándar de facto, recorta el uso de VRAM en torno a un 30–50 % adicional y entrena ~2× más rápido que PEFT convencional: es la diferencia entre que «13B cabe en 16 GB» sea marginal o cómodo. Funciona en Linux o WSL2, no en Windows nativo.

Qué puede entrenar cada nivel de portátil

6 GB de VRAM (RTX 3060 — Legion 5 Gen 6, ZBook Studio G8): modelos de 3B con comodidad, 7B al límite con Unsloth, secuencias cortas y paciencia. Una plataforma real de aprendizaje, no de producción.

8 GB de VRAM (RTX 3070 Ti / RTX A4000 — Legion 5 Gen 7, ZBook Fury G8): el punto de entrada práctico. QLoRA de 7–8B funciona con fiabilidad; este nivel cubre la tarea real más común: enseñar a un modelo pequeño el tono, formato o terminología de tu dominio.

16 GB de VRAM (ThinkPad P15 Gen 2, Legion 7 Gen 6, Precision 7560): territorio de QLoRA de 13–14B, además de 7B con secuencias más largas o lotes mayores. Este es el nivel más alto donde «hazle ajuste fino en mi portátil» es un valor por defecto sensato y no un truco de fiesta.

Tiempos de entrenamiento realistas

Tiempo de reloj estimado para un trabajo pequeño típico —1000 ejemplos de instrucción, 3 épocas, QLoRA de 7B con Unsloth—:

  • RTX 3060 6 GB: ~4–8 horas (si cabe a tu longitud de secuencia)
  • RTX 3070 Ti / A4000 8 GB: ~2,5–5 horas
  • RTX 3080 16 GB / A5000 16 GB: ~1,5–3 horas

Un 13B en el nivel de 16 GB más o menos duplica esas cifras. Son trabajos de una noche entera, no pausas para el café, y por eso importa la refrigeración: los chasis gaming y de estación de trabajo que mantienen las frecuencias durante horas (ver nuestras notas térmicas por análisis) terminan bastante antes que las máquinas finas que hacen throttling.

Cuándo la nube supera a tu portátil

Alquilar una RTX 4090 o una A100 por horas cuesta poco, y para algunos trabajos es sencillamente la decisión correcta. Reglas generales:

  • Haz ajuste fino en local cuando: el modelo sea ≤13B, los datos sean privados o regulados, iteres con frecuencia en trabajos pequeños o ya tengas la máquina de 8–16 GB.
  • Alquila cuando: el modelo sea de 30B o más, un solo entrenamiento supere ~12 horas de portátil, necesites varios experimentos en paralelo o el plazo sea para mañana. Un puñado de euros suele comprar más cómputo del que tu portátil entrega en una noche.

El patrón híbrido funciona mejor: prototipa el dataset y los hiperparámetros en local con un 7B, y luego alquila una GPU grande para el entrenamiento final de 13B/30B.

Antes de hacer ajuste fino siquiera: prueba RAG y prompting

El ajuste fino enseña comportamiento: tono, formato, estilo de dominio. Es una herramienta pobre para inyectar hechos, algo que la recuperación (RAG) maneja mejor y de forma más actualizable. Si tu objetivo es «que el modelo responda a partir de mis documentos», construye primero RAG; haz ajuste fino solo cuando el problema sea el estilo de salida o el formato de la tarea. Muchos proyectos de «necesitamos ajuste fino» terminan en un buen prompt de sistema.

Resumen

  • El ajuste fino completo necesita más de 60 GB de VRAM; los portátiles hacen QLoRA, que es suficiente para la mayoría de tareas reales.
  • Niveles de VRAM: 6 GB = 3B (7B al límite), 8 GB = 7–8B con fiabilidad, 16 GB = 13–14B. Usa Unsloth.
  • Un entrenamiento de 7B con QLoRA sobre 1000 ejemplos es un trabajo de 1,5–8 horas según tu GPU: de una noche, no instantáneo.
  • Los datos privados y las iteraciones pequeñas y frecuentes favorecen lo local; los modelos de 30B o más y los plazos favorecen alquilar una GPU en la nube.
  • ¿Quieres hechos, no estilo? Construye RAG antes de hacer ajuste fino de nada.

Artículos relacionados