73 models at Q4 路 24 GB budget
Local AI models for 24GB VRAM
24 GB is the enthusiast sweet spot. 30B dense models fit, mid-size mixture-of-experts become usable, and local image or short video generation is realistic.
Typical fit: 30B dense models, mid-size MoE, or local video. 路 Example:RTX 4090
- Qwen 3 0.6BAlibaba 路 0.6B 路 0.8 GB Q4
- Qwen 3.5 0.8BAlibaba 路 0.8B 路 0.9 GB Q4
- Llama 3.2 1BMeta 路 1B 路 1 GB Q4
- Gemma 3 1BGoogle 路 1B 路 1 GB Q4
- Wan 2.1 T2V 1.3BAlibaba 路 1.3B 路 1.2 GB Q4
- Qwen 2.5 Coder 1.5BAlibaba 路 1.5B 路 1.3 GB Q4
- DeepSeek R1 1.5BDeepSeek 路 1.5B 路 1.3 GB Q4
- Qwen 3 1.7BAlibaba 路 1.7B 路 1.4 GB Q4
- Qwen 3.5 2BAlibaba 路 2B 路 1.5 GB Q4
- Llama 3.2 3BMeta 路 3B 路 2 GB Q4
- SmolLM3 3BHuggingFace 路 3B 路 2 GB Q4
- Granite 4.1 3BIBM 路 3B 路 2 GB Q4
- Ministral 3 3BMistral AI 路 3B 路 2 GB Q4
- Phi-4 Mini ReasoningMicrosoft 路 3.8B 路 2.4 GB Q4
- Gemma 3 4BGoogle 路 4B 路 2.5 GB Q4
- Qwen 3.5 4BAlibaba 路 4B 路 2.5 GB Q4
- FLUX.2 Klein 4BBlack Forest Labs 路 4B 路 2.5 GB Q4
- Qwen3-VL 4BAlibaba 路 4.4B 路 2.8 GB Q4
- Gemma 4 E2B ITGoogle 路 5B 路 3.1 GB Q4
- Wan 2.2 TI2V 5BAlibaba 路 5B 路 3.1 GB Q4
- Z-Image TurboAlibaba 路 6B 路 3.6 GB Q4
- Qwen 2.5 Coder 7BAlibaba 路 7B 路 4.1 GB Q4
- DeepSeek R1 Distill 7BDeepSeek 路 7B 路 4.1 GB Q4
- Gemma 4 E4B ITGoogle 路 8B 路 4.6 GB Q4
- Llama 3.1 8BMeta 路 8B 路 4.6 GB Q4
- Qwen 3 8BAlibaba 路 8B 路 4.6 GB Q4
- Granite 4.1 8BIBM 路 8B 路 4.6 GB Q4
- Ministral 8BMistral AI 路 8B 路 4.6 GB Q4
- HunyuanVideo 1.5Tencent 路 8.3B 路 4.8 GB Q4
- Qwen3-VL 8BAlibaba 路 8.8B 路 5 GB Q4
- GLM-4 9BZhipu AI 路 9B 路 5.1 GB Q4
- Nemotron Nano 9B v2NVIDIA 路 9B 路 5.1 GB Q4
- Qwen 3.5 9BAlibaba 路 9B 路 5.1 GB Q4
- Ornith 1.0 9BDeepReinforce 路 9B 路 5.1 GB Q4
- FLUX.2 Klein 9BBlack Forest Labs 路 9B 路 5.1 GB Q4
- Gemma 3 12BGoogle 路 12B 路 6.6 GB Q4
- Mistral Nemo 12BMistral AI 路 12B 路 6.6 GB Q4
- Gemma 4 12B ITGoogle 路 12B 路 6.6 GB Q4
- Phi-4 14BMicrosoft 路 14B 路 7.7 GB Q4
- Qwen 3 14BAlibaba 路 14B 路 7.7 GB Q4
- DeepSeek R1 Distill 14BDeepSeek 路 14B 路 7.7 GB Q4
- Ministral 3 14BMistral AI 路 14B 路 7.7 GB Q4
- LTX 2.3Lightricks 路 19B 路 10.2 GB Q4
- Qwen Image 2512Alibaba 路 20B 路 10.7 GB Q4
- GPT-OSS 20BOpenAI 路 3.6B active 路 11.3 GB Q4
- LFM2 24BLiquid AI 路 2.3B active 路 12.8 GB Q4
- Devstral Small 2 24BMistral AI 路 24B 路 12.8 GB Q4
- Mistral Small 3.1 24BMistral AI 路 24B 路 12.8 GB Q4
- DiffusionGemma 26B-A4B ITGoogle 路 4B active 路 13.8 GB Q4
- Gemma 4 26B-A4B ITGoogle 路 4B active 路 14.3 GB Q4
- Qwen 3.8 27BAlibaba 路 27B 路 14.3 GB Q4
- Wan 2.2 T2V A14BAlibaba 路 14B active 路 14.3 GB Q4
- Qwen 3.5 27BAlibaba 路 27.8B 路 14.7 GB Q4
- Qwen 3.6 27BAlibaba 路 27.8B 路 14.7 GB Q4
- Qwen 3 30B-A3BAlibaba 路 3.3B active 路 15.9 GB Q4
- Nemotron 3 Nano 30BNVIDIA 路 3B active 路 15.9 GB Q4
- Granite 4.1 30BIBM 路 30B 路 15.9 GB Q4
- North Mini CodeCohere 路 3B active 路 15.9 GB Q4
- Qwen 3 Coder 30B-A3BAlibaba 路 3B active 路 15.9 GB Q4
- Muse Glimmer 30BMeta 路 30B 路 15.9 GB Q4
- Qwen3-VL 30B-A3BAlibaba 路 3B active 路 16.4 GB Q4
- Qwen 3 32BAlibaba 路 32B 路 16.9 GB Q4
- DeepSeek R1 Distill 32BDeepSeek 路 32B 路 16.9 GB Q4
- OLMo 2 32BAllen AI 路 32B 路 16.9 GB Q4
- FLUX.2 DevBlack Forest Labs 路 32B 路 16.9 GB Q4
- Gemma 4 31B ITGoogle 路 33B 路 17.4 GB Q4
- Gemma 4 31BGoogle 路 33B 路 17.4 GB Q4
- MiniMax H3MiniMax 路 33B 路 17.4 GB Q4
- Agents-A1 35B-A3BInternScience 路 3B active 路 18.4 GB Q4
- Command R 35BCohere 路 35B 路 18.4 GB Q4
- Qwen 3.5 35B-A3BAlibaba 路 3B active 路 18.4 GB Q4
- Ornith 1.0 35B-A3BDeepReinforce 路 3B active 路 18.4 GB Q4
- Qwen 3.6 35B-A3BAlibaba 路 3B active 路 18.9 GB Q4
These sizes assume Q4_K_M plus a little runtime overhead.Grade the full catalog on your machineorpick a specific GPU.
Common questions
- What models can an RTX 4090 run locally?
- Almost every popular open chat and coding model at high quality, plus FLUX-class image generation and the lighter video checkpoints.