42 modelos en Q4 · presupuesto de 8 GB

Modelos de IA local para 8GB de VRAM

8 GB es el presupuesto de GPU de consumo más habitual. En Q4 puedes ejecutar cómodamente modelos de chat de 3B–9B, además de los checkpoints de imagen más pequeños. Las mezclas de expertos siguen cargando todos los expertos, así que los archivos MoE grandes no caben.

Encaje típico: Modelos de chat de 3B–9B en Q4, además de modelos de imagen muy pequeños. · Ejemplo:RTX 4060

Estos tamaños asumen Q4_K_M más un pequeño overhead de runtime.Califica el catálogo completo en tu máquinaoelige una GPU concreta.

Preguntas frecuentes

¿Qué LLM puedo ejecutar con 8GB de VRAM?
Los modelos densos de 7B–9B en Q4 son el punto óptimo. Los modelos más pequeños de 1B–4B se sentirán más rápidos. Evita los checkpoints densos de 14B o más y los archivos MoE grandes salvo que hagas offload a la RAM del sistema (mucho más lento).
¿8GB son suficientes para generar imágenes en local?
Sí, para modelos compactos como FLUX Klein 4B o similares. FLUX.2 Dev completo y los modelos de vídeo grandes no caben.