Skip to content

Best AI Models for 128 GB VRAM

Maximum consumer — 200B+ models, research workloads. Here are all 99 models you can run locally with 128 GB of memory.

Hardware with 128 GB Memory

Runs Comfortably (97)

These models fit with room to spare for context window and OS overhead.

ModelParamsQuantizationVRAMQuality
Mixtral 8x22B141BQ4_K_M86 GB4
Devstral 2 123B123BQ4_K_M67 GB4
Mistral Large 2 123B123BQ4_K_M67 GB4
Qwen 3.5 122B122BQ4_K_M85 GB4
gpt-oss 120B117BMXFP470 GB4
Llama 4 Scout (109B/17B active)109BQ4_K_M72 GB4
Llama 3.2 Vision 90B90BQ8_096 GB4
Qwen 2.5 72B72BQ8_074 GB5
Qwen 2.5 VL 72B72BQ8_078 GB4
Cogito 70B70BQ8_076 GB4
DeepSeek R1 70B70BQ8_072 GB5
Llama 3.1 70B70BQ8_072 GB5
Llama 3.3 70B70BQ8_072 GB5
Dolphin Mixtral 8x7B47BF1694 GB5
Mixtral 8x7B47BQ8_049 GB5
Command R 35B35BQ8_037 GB5
Qwen 3.5 35B A3B35BQ8_020 GB5
Qwen 3.6 35B-A3B35BBF1678 GB5
Nous Hermes 2 34B34BF1670 GB5
Yi 1.5 34B34BF1670 GB5
Laguna XS 2.133BBF1672 GB5
WizardCoder 33B33BF1669.5 GB5
Aya Expanse 32B32BQ8_038 GB5
Cogito 32B32BF1668 GB5
DeepSeek R1 32B32BQ8_034 GB5
Qwen 2.5 32B32BQ8_034 GB5
Qwen 2.5 Coder 32B32BF1670 GB5
Qwen 3 32B32BF1670 GB5
QwQ 32B32BF1668 GB5
Gemma 4 31B31BF1666 GB5
Qwen 3 30B-A3B (MoE)30BF1667 GB5
Gemma 2 27B27BQ8_029 GB5
Gemma 3 27B27BF1660 GB5
Qwen 3.5 27B27BQ8_033 GB5
Qwen 3.6 27B27BBF1662 GB5
Gemma 4 26B26BQ8_030 GB5
Devstral 24B24BF1653 GB5
Magistral Small 24B24BF1652 GB5
Mistral Small 3.1 24B24BF1654 GB5
Codestral 22B22BQ8_024 GB5
gpt-oss 20B21BMXFP415 GB4
InternLM 2.5 20B20BF1642 GB5
StarCoder2 15B15BQ8_017 GB5
DeepSeek R1 14B14BQ8_016 GB5
Phi-4 14B14BQ8_016 GB5
Phi-4 Reasoning 14B14BF1632 GB5
Qwen 2.5 14B14BQ8_016 GB5
Qwen 2.5 Coder 14B14BF1633 GB5
Qwen 3 14B14BF1633 GB5
Gemma 3 12B12BF1628 GB5
Mistral Nemo 12B12BF1628 GB5
Llama 3.2 Vision 11B11BF1626 GB5
Falcon 3 10B10BF1624 GB5
Gemma 2 9B9BF1620 GB5
Qwen 3.5 9B9BQ8_011.5 GB5
Yi 1.5 9B9BF1620 GB5
Yi Coder 9B9BF1621 GB5
Aya Expanse 8B8BQ8_010.5 GB5
Cogito 8B8BF1619.5 GB5
DeepSeek R1 8B8BF1620 GB5
Dolphin 3 8B8BF1618 GB5
Granite 3.3 8B8BF1618 GB5
Llama 3.1 8B8BF1618 GB5
Nemotron 3 Nano 8B8BF1619.5 GB5
Nous Hermes 2 8B8BF1618 GB5
Qwen 3 8B8BF1620 GB5
Codestral Mamba 7B7BF1617 GB5
DeepSeek R1 7B7BF1616 GB5
Falcon 3 7B7BF1617.5 GB5
InternLM 2.5 7B7BF1616 GB5
Mistral 7B7BF1616 GB5
OpenChat 3.5 7B7BF1617 GB5
Qwen 2.5 7B7BF1616 GB5
Qwen 2.5 Coder 7B7BF1616 GB5
Qwen 2.5 VL 7B7BF1618.5 GB5
StarCoder2 7B7BF1616 GB5
WizardLM 2 7B7BF1617 GB5
Yi 1.5 6B6BF1614 GB5
Gemma 3 4B4BF1611.5 GB5
Gemma 3n E4B4BF1611 GB5
Gemma 4 E4B4BQ8_010 GB5
Qwen 3 4B4BF1611 GB5
Qwen 3.5 4B4BQ8_06.5 GB4
Phi-3 Mini 3.8B3.8BF169.6 GB5
Phi-4 Mini 3.8B3.8BF1610.5 GB5
Llama 3.2 3B3BF168 GB5
StarCoder2 3B3BF168 GB5
Gemma 2 2B2BF166 GB5
Gemma 3n E2B2BF166.5 GB5
Gemma 4 E2B2BQ8_06 GB5
Qwen 3.5 2B2BQ8_04.5 GB4
SmolLM2 1.7B1.7BF164.4 GB5
DeepSeek R1 1.5B1.5BF165 GB5
Gemma 3 1B1BF163.5 GB5
Llama 3.2 1B1BF164 GB5
Qwen 3.5 0.8B0.8BQ8_02 GB4
Qwen 3 0.6B0.6BF163.3 GB5

Tight Fit (2)

These models run but with limited context window. Close other apps to free memory.

ModelParamsQuantizationVRAMQuality
Command A 111B111BQ8_0117 GB5
Command R+ 104B104BQ8_0110 GB5

Want to check a specific combination?

Use the compatibility checker to see exactly how a model runs on your specific hardware, with performance estimates.

Open Compatibility Checker
8 GBEntry-level local AI 12 GBThe minimum for a good experience 16 GBThe sweet spot 24 GBSerious local AI