Modelos LLM para 8GB de VRAM: la guía 2026


Tener una GPU con 8 GB de VRAM en 2026 no te convierte en un marginal de la IA local. Al contrario: los modelos LLM 8GB VRAM han mejorado tanto que hoy puedes correr modelos que rivalizan con APIs de pago sin salir de tu habitación. ¿El truco? Elegir bien qué instalar y configurar el contexto con cabeza. Vamos a verlo.

La RTX 3060 Ti, la RTX 4060, la RTX 3070, la RX 7600… todas comparten un mismo techo: 8 GB de VRAM. Pero también comparten algo que muchos olvidan al comparar tarjetas: el ancho de banda de memoria es lo que determina la velocidad de inferencia, no los núcleos CUDA. La RTX 3070, con 448 GB/s, sigue siendo más rápida que la RTX 4060 Ti (288 GB/s) en generación de tokens a pesar de ser una generación anterior. Si ya pasaste por aquí cuando cambiaste la tarjeta gráfica de tu ordenador, ahora toca sacarle partido para IA.

Los mejores modelos LLM 8GB VRAM en 2026

Según los benchmarks oficiales de cada modelo en Hugging Face y las pruebas de quantized.fyi, hay cinco modelos que merecen tu atención si tienes 8 GB de VRAM. Todos se evaluaron con cuantización Q4 o inferior, el punto dulce entre calidad y consumo de memoria. Si te perdiste la guía sobre si cabe un LLM en tu GPU, este post es la continuación natural: allí vimos la teoría del VRAM; aquí vamos con los modelos concretos de 2026.

1. Qwen3.5-9B — el nuevo rey todoterreno

Lanzado por Alibaba en febrero de 2026, Qwen3.5-9B es lo que Qwen3 8B quería ser cuando creciera. Es multimodal nativo —acepta texto, imágenes y vídeo—, usa una arquitectura híbrida de Gated Delta Networks con MoE sparse que entrega inferencia eficiente, y soporta 201 idiomas. En Q4_K_M ocupa entre 5,68 y 6,17 GB según el cuantizador (recomendamos el de unsloth por su optimización Dynamic 2.0). Con 8K de contexto, el consumo total de VRAM ronda los 6,8-7,2 GB: justo en el límite de 8 GB, pero cabe.

Los benchmarks son contundentes: 82,5 en MMLU-Pro, 81,7 en GPQA Diamond, 91,5 en IFEval, 65,6 en LiveCodeBench v6 y 83,2 en HMMT Feb 25. En visión, 78,4 en MMMU y 78,9 en MathVision. En agentes, 66,1 en BFCL-V4 y 79,1 en TAU2-Bench. Supera a su predecesor Qwen3 8B en prácticamente every métrica publicada.

Una diferencia importante respecto a Qwen3: el modo thinking está activo por defecto y no existe el soft switch /no-think. Para desactivarlo hay que configurar enable_thinking: False en los parámetros de la API. El modelo piensa antes de responder, lo que mejora la calidad pero consume más tokens.

2. Gemma 4 12B Unified — el polivalente con audio nativo

Google liberó Gemma 4 12B Unified en 2026 bajo Apache 2.0, y es un modelo peculiar: a diferencia del resto de la familia Gemma 4, la versión 12B es encoder-free. Esto significa que no usa encoders dedicados para imagen o audio, sino que proyecta los datos brutos directamente al espacio de embeddings del modelo. ¿La ventaja? Latencia multimodal mínima y un tamaño de despliegue perfecto para hardware de consumo.

Acepta texto, imagen, audio y vídeo de forma nativa. Soporta 140+ idiomas y un contexto de 256K tokens. En benchmarks: 77,2 en MMLU-Pro, 78,8 en GPQA Diamond, 72,0 en LiveCodeBench v6 (donde supera a Qwen3.5-9B), 79,7 en MathVision y 38,5 en CoVoST (traducción de voz). Es el único modelo de esta lista con comprensión de audio nativa.

El reto en 8GB: en Q4_K_M ocupa 7,66 GB solo de pesos, lo que con KV cache y overhead supera los 8 GB. Para que quepa tienes dos opciones: usar IQ4_XS (6,78 GB, lo que deja margen para 8K de contexto) o la versión QAT oficial de Google (gemma-4-12B-it-qat-q4_0-gguf), optimizada específicamente para 4-bit. Ambas implican algo más de pérdida de calidad que un Q4_K_M estándar, pero el modelo sigue siendo muy capaz.

Si 12B te parece demasiado ajustado, Gemma 4 también existe en versión 4B (multimodal, 128K de contexto, solo 4,0 GB de VRAM en Q4) como alternativa ligera que te deja margen para modelos de embeddings simultáneos.

3. Phi-4-mini (3.8B) — el velocista

El modelo pequeño de Microsoft consume solo 3,5 GB de VRAM en Q4_K_M y genera más de 60 tokens por segundo en prácticamente cualquier GPU de 8GB moderna. Su puntuación en MMLU ronda los 68,5 puntos, a apenas 4-5 de competidores de 7-8B con el doble de parámetros. Donde flojea es en razonamiento complejo de múltiples pasos. Donde brilla: velocidad, consistencia y batería en portátiles. Si quieres respuestas que se sientan instantáneas, este es tu modelo.

4. DeepSeek-R1-Distill-Qwen3-7B — el pensador

Destilado de DeepSeek-R1 sobre una base Qwen3 7B, este modelo ocupa los mismos 5,0 GB en Q4_K_M pero se comporta de forma muy distinta: genera muchísimos más tokens por respuesta porque razona en voz alta antes de contestar. En problemas de matemáticas o depuración de código, suele superar a modelos mucho más grandes. En «¿cuál es la capital de Francia?», gastará 800 tokens pensando si la pregunta es una trampa. Resérvalo para sesiones donde la calidad del razonamiento importe más que el tiempo de respuesta.

5. Granite 4.1 (8B) — el operario

El caballo oscuro de IBM, publicado en 2026 bajo Apache 2.0. No es el más inteligente ni el más creativo, pero es estable. En un test de 200 llamadas agentic con salida JSON estructurada, fue uno de los dos modelos de 8B que no rompió el formato bajo carga —el otro fue Qwen3 8B— mientras que Llama 3.1 8B falló en el 8% de las llamadas. Si estás construyendo un sistema donde el modelo es una pieza más y necesitas que se comporte, Granite 4 es la elección aburrida y fiable.

Comparativa de los modelos LLM 8GB VRAM

Comparativa visual de cinco modelos LLM para 8GB VRAM: Qwen3.5-9B, Gemma 4 12B, Phi-4-mini, DeepSeek-R1 y Granite 4

Aquí tienes el resumen práctico. Qwen3.5-9B y Gemma 4 12B son los modelos más potentes de la lista, pero con estrategias distintas: Qwen3.5-9B cabe en Q4_K_M estándar (6,8-7,2 GB), mientras que Gemma 4 12B requiere cuantización más agresiva (IQ4_XS, ~7,4 GB) para entrar en 8GB. La recompensa de Gemma 4 12B es el audio nativo y mejor LiveCodeBench; la de Qwen3.5-9B es mejor MMLU-Pro, GPQA y más idiomas.

  • Qwen3.5-9B: 5,68-6,17 GB en disco (Q4_K_M), ~6,8-7,2 GB VRAM. Multimodal (texto+imagen+vídeo), MoE, 201 idiomas, modo thinking. Apache 2.0.
  • Gemma 4 12B: 6,78 GB (IQ4_XS), ~7,4 GB VRAM. Multimodal encoder-free (texto+imagen+audio+vídeo), 140+ idiomas, 256K contexto. Apache 2.0.
  • Phi-4-mini: 2,5 GB en disco, 3,6 GB VRAM. Velocidad pura, 60+ t/s. MIT.
  • DeepSeek-R1-Distill: 5,0 GB, 6,6 GB VRAM. Razonamiento profundo. MIT.
  • Granite 4.1 8B: 5,1 GB, 6,7 GB VRAM. Agentic, JSON, tool use. Apache 2.0.

Lo que NO cabe en 8 GB (y no merece la pena forzar)

Según las pruebas de 9bench con tarjetas de 8 GB en 2026, hay una zona «funciona, pero…» y otra directamente «ni lo intentes». Los modelos de 13B en Q4 necesitan 7,4 GB solo de pesos, y con el KV cache picas los 10 GB. Puedes usar --lowvram en llama.cpp para descargar capas a la CPU, pero perderás un 50% de velocidad. Los modelos de 22B-30B generan a 1-3 tokens por segundo: más lento que la velocidad de lectura humana. Y Llama 70B, con 40 GB de pesos, es directamente imposible.

Nota: Gemma 4 12B en Q4_K_M (7,66 GB) entraría en esta categoría «funciona, pero…» — requiere offload. Por eso recomendamos IQ4_XS o la versión QAT oficial de Google, que sí caben. El consejo práctico: quédate en la clase 7B-12B con cuantización agresiva si es necesario, y si algún día necesitas 12B cómodo en Q4_K_M estándar, el mejor salto calidad-precio es una RTX 3060 de 12 GB de segunda mano por unos 200 euros.

Configuración recomendada para tu GPU de 8GB

Tres ajustes que marcan la diferencia entre una experiencia fluida y una frustrante con modelos LLM 8GB VRAM:

1. Reduce el contexto a 8K. Ollama viene con 32K por defecto. En 8 GB eso es un problema. Configura OLLAMA_CONTEXT_LENGTH=8192 en tu entorno y a menudo duplicarás la velocidad efectiva. La pérdida de capacidad es menor de lo que crees para la mayoría de tareas.

2. Desconecta el monitor de la GPU. Si tu CPU tiene gráficos integrados, conecta tus monitores ahí. Un display 4K se come 500-700 MB de VRAM solo en framebuffer. En una tarjeta de 8 GB, eso es la diferencia entre cargar el modelo completo en GPU o caer silenciosamente a la CPU.

3. Activa Flash Attention y KV cache cuantizado. En Ollama 0.5+ debería estar activo por defecto, pero verifícalo con OLLAMA_FLASH_ATTENTION=1. El KV cache en q8_0 reduce a la mitad el consumo de memoria del cache con una pérdida de calidad mínima.

Si aún no tienes Ollama configurado o estás dudando entre interfaces, echa un vistazo a nuestra comparativa Onyx vs Open WebUI: tu primer LLM local sin drama, donde explicamos cuál te conviene según tu nivel. Y si quieres exprimir cada vatio de tu GPU mientras corre inferencia, el tutorial de undervolt y overclocking en tu GPU que publicamos sigue siendo igual de válido: reducir consumo y mantener rendimiento es justo lo que necesitas cuando la VRAM está al límite.

El veredicto: 8GB de VRAM sigue siendo una herramienta seria

En 2026, 8 GB de VRAM ya no es «suficiente para una demo técnica». Con Qwen3.5-9B o Gemma 4 12B como conductor diario, tienes una herramienta que maneja trabajo real: generación de código, análisis de documentos, traducción multilingüe, pipelines de RAG, interpretación de imágenes, e incluso transcripción y traducción de audio si eliges Gemma. La restricción de hardware ha empujado a los investigadores hacia la eficiencia, y los usuarios de 8 GB somos los beneficiarios.

El mejor consejo que podemos darte: presta más atención al ancho de banda de memoria que a los núcleos CUDA. La RTX 3070 sigue siendo competitiva en 2026 —una tarjeta de hace seis años— porque el ancho de banda es lo que importa en inferencia. Cualquier GPU de 8GB con buen ancho de banda está en el mismo club. Elige un modelo que quepa limpiamente bajo 7,5 GB, pon el contexto a 8K, y tendrás un equipo que golpea muy por encima de su peso.

Parte del contenido ha sido generado con IA, aunque revisado por mí.


Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *