Meta · 1B · Densa

Meta's smallest Llama for edge devices Comprueba si tu GPU o Mac puede ejecutar Llama 3.2 1B localmente — 1 GB mínimo, 2 GB recomendado.

2024-09128K contexto

Opciones de cuantización

CuantBitsVRAMCalidadEstado
Q2_K20.8 GBlow
Q3_K_M30.9 GBmoderate
Q4_K_M41 GBgood
Q5_K_M51.1 GBgood
Q6_K61.3 GBexcellent
Q8_081.5 GBexcellent
F16162.5 GBlossless

Sobre este modelo

The Meta Llama 3.2 collection of multilingual large language models (LLMs) is a collection of pretrained and instruction-tuned generative models in 1B and 3B sizes (text in/text out). The Llama 3.2 instruction-tuned text only models are optimized for multilingual dialogue use cases, including agentic retrieval and summarization tasks. They outperform many of the available open source and closed chat models on common industry benchmarks.

Sizes

3B parameters (default)

The 3B model outperforms the Gemma 2 2.6B and Phi 3.5-mini models on tasks such as:

  • Following instructions
  • Summarization
  • Prompt rewriting
  • Tool use
ollama run llama3.2

1B parameters

The 1B model is competitive with other 1-3B parameter models. It’s use cases include:

  • Personal information management
  • Multilingual knowledge retrieval
  • Rewriting tasks running locally on edge
ollama run llama3.2:1b

Benchmarks

Llama 3.2 instruction-tuned benchmarks

Supported Languages: English, German, French, Italian, Portuguese, Hindi, Spanish, and Thai are officially supported. Llama 3.2 has been trained on a broader collection of languages than these 8 supported languages.

¿Puedo ejecutar Llama 3.2 1B localmente?

¿Puedo ejecutar Llama 3.2 1B localmente?
Llama 3.2 1B necesita alrededor de 1 GB de memoria como mínimo y 2 GB recomendados. Abre esta página para evaluarlo con tu GPU o Mac, y luego ejecútalo con runai, Ollama o LM Studio.
¿Cuánta VRAM necesita Llama 3.2 1B?
En Q4_K_M, Llama 3.2 1B usa aproximadamente 1 GB de VRAM. Cuantizaciones más altas necesitan más memoria; las más bajas caben en tarjetas más ajustadas con una pérdida de calidad.