42 models at Q4 · 8 GB budget
Local AI models for 8GB VRAM
8 GB is the most common consumer GPU budget. At Q4 you can run 3B–9B chat models comfortably, plus the smallest image checkpoints. Mixture-of-experts still load every expert, so big MoE files will not fit.
Typical fit: 3B–9B chat models at Q4, plus tiny image models. · Example:RTX 4060
- Qwen 3 0.6BAlibaba · 0.6B · 0.8 GB Q4
- Qwen 3.5 0.8BAlibaba · 0.8B · 0.9 GB Q4
- Llama 3.2 1BMeta · 1B · 1 GB Q4
- Gemma 3 1BGoogle · 1B · 1 GB Q4
- Wan 2.1 T2V 1.3BAlibaba · 1.3B · 1.2 GB Q4
- Qwen 2.5 Coder 1.5BAlibaba · 1.5B · 1.3 GB Q4
- DeepSeek R1 1.5BDeepSeek · 1.5B · 1.3 GB Q4
- Qwen 3 1.7BAlibaba · 1.7B · 1.4 GB Q4
- Qwen 3.5 2BAlibaba · 2B · 1.5 GB Q4
- Llama 3.2 3BMeta · 3B · 2 GB Q4
- SmolLM3 3BHuggingFace · 3B · 2 GB Q4
- Granite 4.1 3BIBM · 3B · 2 GB Q4
- Ministral 3 3BMistral AI · 3B · 2 GB Q4
- Phi-4 Mini ReasoningMicrosoft · 3.8B · 2.4 GB Q4
- Gemma 3 4BGoogle · 4B · 2.5 GB Q4
- Qwen 3.5 4BAlibaba · 4B · 2.5 GB Q4
- FLUX.2 Klein 4BBlack Forest Labs · 4B · 2.5 GB Q4
- Qwen3-VL 4BAlibaba · 4.4B · 2.8 GB Q4
- Gemma 4 E2B ITGoogle · 5B · 3.1 GB Q4
- Wan 2.2 TI2V 5BAlibaba · 5B · 3.1 GB Q4
- Z-Image TurboAlibaba · 6B · 3.6 GB Q4
- Qwen 2.5 Coder 7BAlibaba · 7B · 4.1 GB Q4
- DeepSeek R1 Distill 7BDeepSeek · 7B · 4.1 GB Q4
- Gemma 4 E4B ITGoogle · 8B · 4.6 GB Q4
- Llama 3.1 8BMeta · 8B · 4.6 GB Q4
- Qwen 3 8BAlibaba · 8B · 4.6 GB Q4
- Granite 4.1 8BIBM · 8B · 4.6 GB Q4
- Ministral 8BMistral AI · 8B · 4.6 GB Q4
- HunyuanVideo 1.5Tencent · 8.3B · 4.8 GB Q4
- Qwen3-VL 8BAlibaba · 8.8B · 5 GB Q4
- GLM-4 9BZhipu AI · 9B · 5.1 GB Q4
- Nemotron Nano 9B v2NVIDIA · 9B · 5.1 GB Q4
- Qwen 3.5 9BAlibaba · 9B · 5.1 GB Q4
- Ornith 1.0 9BDeepReinforce · 9B · 5.1 GB Q4
- FLUX.2 Klein 9BBlack Forest Labs · 9B · 5.1 GB Q4
- Gemma 3 12BGoogle · 12B · 6.6 GB Q4
- Mistral Nemo 12BMistral AI · 12B · 6.6 GB Q4
- Gemma 4 12B ITGoogle · 12B · 6.6 GB Q4
- Phi-4 14BMicrosoft · 14B · 7.7 GB Q4
- Qwen 3 14BAlibaba · 14B · 7.7 GB Q4
- DeepSeek R1 Distill 14BDeepSeek · 14B · 7.7 GB Q4
- Ministral 3 14BMistral AI · 14B · 7.7 GB Q4
These sizes assume Q4_K_M plus a little runtime overhead.Grade the full catalog on your machineorpick a specific GPU.
Common questions
- What LLM can I run on 8GB VRAM?
- 7B–9B dense models at Q4 are the sweet spot. Smaller 1B–4B models will feel faster. Avoid 14B+ dense checkpoints and large MoE files unless you offload to system RAM (much slower).
- Is 8GB enough for local image generation?
- Yes for compact models such as FLUX Klein 4B or similar. Full FLUX.2 Dev and large video models will not fit.