Documentación de IA local: VRAM, cuantización y GGUF

Términos y conceptos clave usados en LocalAI, explicados de forma simple.

Parámetros

Cuando ves "7B" o "70B", ese es el número de parámetros (pesos) del modelo — en miles de millones. Más parámetros generalmente significa un modelo más inteligente y capaz, pero también necesita más memoria y es más lento. Un modelo de 7B es ideal para tareas básicas, 13B–34B es un punto óptimo sólido, y 70B+ ofrece una calidad casi de vanguardia pero necesita hardware serio.

Compromiso entre tamaño y capacidad

1-3BRápido7-8BBueno13-14BMejor27-34BGenial70BExcelente405B+Vanguardia↑ Más inteligente↓ Más rápido

Cuantización

La cuantización reduce la precisión de los pesos de un modelo para hacerlo más pequeño y rápido, a costa de algo de calidad. Los nombres indican el ancho de bits:

Calidad vs. tamaño (para un modelo de 7B)

FormatoCalidadTamañoF16~13 GB100%Q8_0~6.7 GB~99%Q6_K~5.3 GB~95%Q4_K_M~3.9 GB~88%Q2_K~2.5 GB~60%Barra = retención de calidad respecto al original • ★ = mejor equilibrio
FormatoBitsCalidadNotas
Q2_K2BajaTamaño más pequeño, pérdida de calidad notable
Q4_K_M4BuenaMejor equilibrio entre tamaño y calidad — la más popular
Q6_K6Muy buenaCasi sin pérdidas, aumento moderado de tamaño
Q8_08ExcelentePérdida mínima de calidad, archivo más grande
F1616OriginalPrecisión completa, el tamaño más grande

VRAM

La VRAM es la memoria de tu GPU. Para ejecutar un modelo, el archivo cuantizado completo debe caber en la VRAM (o en la memoria unificada en Apple Silicon). Si un modelo necesita 8 GB de VRAM y tu GPU tiene 6 GB, no funcionará bien — fallará o recurrirá a una inferencia por CPU mucho más lenta.

MoE (mezcla de expertos)

Un modelo Mixture of Experts (mezcla de expertos) divide sus parámetros en grupos llamados "expertos". En cada token, solo unos pocos expertos están activos — por ejemplo, Mixtral 8x7B tiene 46.7B de parámetros totales pero solo activa ~12.9B por token. Esto significa que obtienes la calidad de un modelo más grande con la velocidad de uno más pequeño. La contrapartida: el modelo completo igualmente debe caber en memoria, aunque solo una parte se ejecute durante la inferencia.

Enrutamiento de expertos MoE (ejemplo Mixtral)

TokenRoutertop-2Experto 1 ✓Experto 2 ✓Experto 3Experto 4... ×8 expertos en totalSalidaActivos: ~12.9BTotal: 46.7BVRAM: todos los 46.7B

Arquitectura densa vs. MoE

Un modelo denso activa todos sus parámetros en cada token — lo que ves es lo que obtienes. Un modelo MoE tiene más parámetros totales pero solo usa un subconjunto por token. Los modelos densos son más simples y predecibles en cuanto a memoria/velocidad. Los modelos MoE pueden rendir por encima de su peso en calidad, pero necesitan más VRAM de lo que sugiere su número de parámetros activos.

Longitud de contexto

La longitud de contexto es la cantidad de tokens que el modelo puede procesar a la vez — entrada y salida combinadas. Un modelo con "contexto de 128K" puede manejar aproximadamente 100.000 palabras en una sola conversación. Un contexto más largo es ideal para analizar documentos o conversaciones extensas, pero usa más memoria. La mayoría de los usos locales funcionan bien con un contexto de 4K–8K.

Tokens por segundo (tok/s)

Esta es la velocidad de inferencia — qué tan rápido el modelo genera texto. Una guía aproximada:

  • 60+ tok/s — Sensación instantánea, ideal para uso interactivo
  • 30–60 tok/s — Rápido y cómodo
  • 15–30 tok/s — Usable, con ligera espera
  • 5–15 tok/s — Aceptable para tareas por lotes
  • <5 tok/s — Frustrante para uso interactivo

Formato GGUF

GGUF es el formato de archivo usado por llama.cpp y herramientas como Ollama, LM Studio y GPT4All. Almacena los pesos cuantizados del modelo en un solo archivo listo para ejecutarse en CPU o GPU. Cuando descargas un modelo de HuggingFace para uso local, normalmente buscas la versión GGUF.

Ancho de banda de memoria

El ancho de banda de memoria (medido en GB/s) determina qué tan rápido se pueden leer datos desde la VRAM. Durante la inferencia, el cuello de botella es leer los pesos del modelo desde la memoria — así que un mayor ancho de banda significa más tokens por segundo. Por eso los Mac con Apple Silicon (con un ancho de banda de memoria unificada alto) pueden ejecutar modelos grandes sorprendentemente bien, y por eso una RTX 4090 genera texto más rápido que una RTX 4060 incluso con el mismo uso de VRAM.

Comparación de ancho de banda de memoria (GB/s)

RTX 4060272M4 Pro273RTX 4070504M4 Max5467900 XTX960RTX 40901008RTX 50901792Mayor ancho de banda = más tok/s con el mismo tamaño de modelo