Skip to content

Best AI Models for 32 GB VRAM

Premium tier — 70B models with quantization. Here are all 84 models you can run locally with 32 GB of memory.

Hardware with 32 GB Memory

Runs Comfortably (76)

These models fit with room to spare for context window and OS overhead.

ModelParamsQuantizationVRAMQuality
Dolphin Mixtral 8x7B47BQ4_K_M26 GB4
Command R 35B35BQ5_K_M26 GB4
Qwen 3.5 35B A3B35BQ8_020 GB5
Qwen 3.6 35B-A3B35BQ4_K_M27 GB4
Nous Hermes 2 34B34BQ4_K_M19 GB4
Yi 1.5 34B34BQ4_K_M21 GB4
Laguna XS 2.133BQ4_K_M22 GB4
WizardCoder 33B33BQ4_K_M22 GB4
Aya Expanse 32B32BQ4_K_M22 GB4
Cogito 32B32BQ4_K_M21.5 GB4
DeepSeek R1 32B32BQ5_K_M23.9 GB4
Qwen 2.5 32B32BQ5_K_M23.9 GB4
Qwen 2.5 Coder 32B32BQ4_K_M23 GB4
Qwen 3 32B32BQ4_K_M23 GB4
QwQ 32B32BQ4_K_M21.5 GB4
Gemma 4 31B31BQ4_K_M22 GB4
Qwen 3 30B-A3B (MoE)30BQ4_K_M22 GB4
Gemma 3 27B27BQ4_K_M20 GB4
Qwen 3.5 27B27BQ4_K_M19 GB4
Qwen 3.6 27B27BQ4_K_M20 GB4
Codestral 22B22BQ8_024 GB5
gpt-oss 20B21BMXFP415 GB4
InternLM 2.5 20B20BQ8_022 GB5
StarCoder2 15B15BQ8_017 GB5
DeepSeek R1 14B14BQ8_016 GB5
Phi-4 14B14BQ8_016 GB5
Phi-4 Reasoning 14B14BQ8_018 GB4
Qwen 2.5 14B14BQ8_016 GB5
Qwen 2.5 Coder 14B14BQ8_019 GB5
Qwen 3 14B14BQ8_019 GB5
Llama 3.2 Vision 11B11BF1626 GB5
Falcon 3 10B10BF1624 GB5
Gemma 2 9B9BF1620 GB5
Qwen 3.5 9B9BQ8_011.5 GB5
Yi 1.5 9B9BF1620 GB5
Yi Coder 9B9BF1621 GB5
Aya Expanse 8B8BQ8_010.5 GB5
Cogito 8B8BF1619.5 GB5
DeepSeek R1 8B8BF1620 GB5
Dolphin 3 8B8BF1618 GB5
Granite 3.3 8B8BF1618 GB5
Llama 3.1 8B8BF1618 GB5
Nemotron 3 Nano 8B8BF1619.5 GB5
Nous Hermes 2 8B8BF1618 GB5
Qwen 3 8B8BF1620 GB5
Codestral Mamba 7B7BF1617 GB5
DeepSeek R1 7B7BF1616 GB5
Falcon 3 7B7BF1617.5 GB5
InternLM 2.5 7B7BF1616 GB5
Mistral 7B7BF1616 GB5
OpenChat 3.5 7B7BF1617 GB5
Qwen 2.5 7B7BF1616 GB5
Qwen 2.5 Coder 7B7BF1616 GB5
Qwen 2.5 VL 7B7BF1618.5 GB5
StarCoder2 7B7BF1616 GB5
WizardLM 2 7B7BF1617 GB5
Yi 1.5 6B6BF1614 GB5
Gemma 3 4B4BF1611.5 GB5
Gemma 3n E4B4BF1611 GB5
Gemma 4 E4B4BQ8_010 GB5
Qwen 3 4B4BF1611 GB5
Qwen 3.5 4B4BQ8_06.5 GB4
Phi-3 Mini 3.8B3.8BF169.6 GB5
Phi-4 Mini 3.8B3.8BF1610.5 GB5
Llama 3.2 3B3BF168 GB5
StarCoder2 3B3BF168 GB5
Gemma 2 2B2BF166 GB5
Gemma 3n E2B2BF166.5 GB5
Gemma 4 E2B2BQ8_06 GB5
Qwen 3.5 2B2BQ8_04.5 GB4
SmolLM2 1.7B1.7BF164.4 GB5
DeepSeek R1 1.5B1.5BF165 GB5
Gemma 3 1B1BF163.5 GB5
Llama 3.2 1B1BF164 GB5
Qwen 3.5 0.8B0.8BQ8_02 GB4
Qwen 3 0.6B0.6BF163.3 GB5

Tight Fit (8)

These models run but with limited context window. Close other apps to free memory.

ModelParamsQuantizationVRAMQuality
Mixtral 8x7B47BQ4_K_M29.7 GB4
Gemma 2 27B27BQ8_029 GB5
Gemma 4 26B26BQ8_030 GB5
Devstral 24B24BQ8_029 GB5
Magistral Small 24B24BQ8_028 GB4
Mistral Small 3.1 24B24BQ8_030 GB5
Gemma 3 12B12BF1628 GB5
Mistral Nemo 12B12BF1628 GB5

Want to check a specific combination?

Use the compatibility checker to see exactly how a model runs on your specific hardware, with performance estimates.

Open Compatibility Checker
8 GBEntry-level local AI 12 GBThe minimum for a good experience 16 GBThe sweet spot 24 GBSerious local AI