¿Cuánta RAM necesitas para LLM locales? 16 vs 32 vs 64 GB explicado
La VRAM se lleva toda la atención, pero la RAM del sistema decide en silencio qué puede ejecutar tu portátil siquiera, sobre todo en las máquinas de gráficos integrados que dominan el mercado de menos de 500 €. Esta guía te da las cuentas del dimensionado, explica por qué cómo está instalada tu RAM importa tanto como cuánta, y muestra qué ampliaciones compensan.
Qué hace realmente la RAM en la IA local
Tres funciones. Primera, en máquinas solo de CPU el modelo entero debe caber en la RAM: no hay VRAM donde esconderse. Segunda, en máquinas con GPU la RAM es la piscina de desbordamiento: llama.cpp y Ollama reparten los modelos entre VRAM y RAM, así que una tarjeta de 6 GB más 32 GB de RAM ejecuta modelos que la tarjeta sola nunca podría. Tercera, el contexto (la caché KV) crece con tu conversación y aterriza donde viva el modelo: el trabajo con contexto largo añade gigabytes por encima del tamaño del modelo.
La tabla de dimensionado
Memoria aproximada necesaria solo para los pesos del modelo con cuantización Q4_K_M (ver nuestra guía de cuantización GGUF para saber qué significa Q4); añade 4–8 GB para Windows, tu navegador y el contexto:
| Tamaño del modelo | Pesos Q4 | Cómodo en CPU con |
|---|---|---|
| 3–4B | ~2–2.5 GB | 8 GB (16 GB de forma realista) |
| 7–8B | ~4–5 GB | 16 GB |
| 13–14B | ~8–9 GB | 16 GB justo, 32 GB cómodo |
| 30–34B | ~18–20 GB | 32 GB justo, 64 GB cómodo |
| 70B | ~40–43 GB | solo 64 GB |
Así que los niveles prácticos: 16 GB mueven los caballos de batalla de 7–8B; 32 GB desbloquean 13B con comodidad y 30B a duras penas; 64 GB son el billete de entrada a los modelos de clase 70B en un portátil, despacio (aproximadamente 1–2 tok/s en las CPU que analizamos, estimado), pero funcionan, lo cual es notable para una máquina de 350 € como un Dell Latitude 5540 al máximo.
Velocidad: el ancho de banda gana a la capacidad
Aquí está la parte que la mayoría de compradores se pierde. La velocidad de inferencia por CPU está limitada casi por completo por el ancho de banda de memoria: cada token generado lee el modelo entero desde la RAM. Consecuencias:
- El doble canal no es opcional. Un solo módulo de 16 GB te da la mitad del ancho de banda de 2×8 GB, y cerca de la mitad de los tokens por segundo. Al comprar de segunda mano, verifica que ambas ranuras están pobladas (HWiNFO → Memory → número de canales); las configuraciones de un solo módulo son comunes en máquinas ex-leasing y lastran en silencio el trabajo con LLM.
- La DDR5 gana a la DDR4 de forma visible. La DDR5-4800 de un ThinkPad T14 Gen 3 es gran parte de por qué logra 4–5 tok/s en un 7B donde máquinas más antiguas con DDR4-2666 logran ~2,5–3.
- Más RAM no significa más rápido. 64 GB ejecutan modelos más grandes que 32 GB; no ejecutan modelos pequeños más rápido. Compra capacidad para los modelos que quieras, canales para la velocidad que quieras.
En máquinas con GPU la misma lógica explica el comportamiento de la descarga: cada capa que se derrama de la VRAM a la RAM cae de ~450 GB/s (GDDR6) a ~50–75 GB/s (DDR4/5 de portátil). Un 13B repartido 80/20 entre una tarjeta de 6 GB y la RAM aún se siente bien; repártelo 50/50 y estarás sobre todo limitado por la CPU. Por eso insistimos tanto en la VRAM, pero la RAM decide si el desbordamiento funciona siquiera.
Economía de las ampliaciones (julio de 2026, estimaciones; comprueba los precios actuales)
La DDR4 SO-DIMM es la ampliación de capacidad más barata de esta afición: unos 40–60 € por 2×16 GB, 90–130 € por 2×32 GB. La DDR5 sube más (~120–170 € por 2×32 GB). Frente a eso:
- Dell Latitude 5540: a 64 GB, la vía capaz de 70B más barata que conocemos: portátil de ~280 € + RAM de ~110 €.
- Legion 5 Gen 6/Gen 7: a 32–64 GB, empareja una GPU de 6–8 GB con una piscina de descarga profunda; el mejor combo de relación calidad-precio general de la web.
- Precision 7560 / ThinkPad P15 Gen 2: cuatro ranuras, hasta 128 GB, excesivo para la mayoría, valiosísimo para experimentos de 70B junto a 16 GB de VRAM.
- La advertencia: el ThinkPad T14s Gen 4 y la mayoría de ultraligeros sueldan su RAM. Lo que compras es con lo que te quedas: compra la configuración de 32 GB o no la compres.
Recomendaciones rápidas
- Comprando por menos de 400 €: prioriza dos ranuras de RAM sobre casi todo lo demás. 16 GB en doble canal hoy, 32–64 GB por 50–110 € cuando pique la ambición.
- Comprando un portátil con GPU: 16 GB de RAM como mínimo, 32 GB si el plan son modelos de 13B o más. La RAM debería ser ~2× tu VRAM como regla perezosa.
- Ya lo tienes: comprueba la configuración de canales hoy: poblar una segunda ranura vacía es una ampliación de 25 € y cinco minutos que puede casi duplicar tus tok/s.
Resumen
- Los pesos de modelo Q4 necesitan aproximadamente: 7B → 5 GB, 13B → 9 GB, 30B → 20 GB, 70B → 43 GB, más 4–8 GB para el SO y el contexto. 16/32/64 GB son los niveles de capacidad reales.
- Velocidad de inferencia por CPU = ancho de banda de memoria: el doble canal más o menos duplica los tok/s frente a un solo módulo, y la DDR5 gana visiblemente a la DDR4.
- En máquinas con GPU, la RAM es la piscina de descarga: decide si los modelos más grandes que tu VRAM funcionan siquiera.
- Las ampliaciones SO-DIMM (~40–130 €) son el mejor gasto por euro y capacidad en IA local; los portátiles con RAM soldada lo pierden, así que especifícalos bien desde el primer día.
- 64 GB en un Latitude de 300 € ejecutan modelos de 70B. Despacio. Pero los ejecutan.