Skip to content

MacBook Pro M4 Max 128GB

Apple · M4 Max · 128GB Unified Memory · Can run 102 models

BuyAppleAmazon
ManufacturerApple
Unified Mem128 GB
ChipM4 Max
CPU Cores16
GPU Cores40
Neural Engine16
Bandwidth546 GB/s
MSRP$4,999
ReleasedNov 8, 2024

AI Notes

The MacBook Pro M4 Max 128GB is the ultimate laptop for local AI. With 128GB of unified memory, it can run 70B models at full precision and even load larger models like Llama 3.1 405B with heavy quantization. The 546 GB/s memory bandwidth ensures excellent inference throughput for the most demanding AI workloads on the go.

Compatible Models

ModelParametersBest QuantVRAM UsedFitEst. Speed
Qwen 3 0.6B600MQ4_K_M2.5 GBRuns~218 tok/s
Qwen 3.5 0.8B800MQ4_K_M1.5 GBRuns~364 tok/s
Gemma 3 1B1BQ8_02 GBRuns~273 tok/s
Llama 3.2 1B1BQ8_03 GBRuns~182 tok/s
DeepSeek R1 1.5B1.5BQ8_03 GBRuns~182 tok/s
SmolLM2 1.7B1.7BQ8_02.7 GBRuns~202 tok/s
Gemma 2 2B2BQ8_04 GBRuns~137 tok/s
Gemma 3n E2B2BQ4_K_M3.3 GBRuns~165 tok/s
Gemma 4 E2B2BQ4_K_M4 GBRuns~137 tok/s
Qwen 3.5 2B2BQ4_K_M3 GBRuns~182 tok/s
Llama 3.2 3B3BQ8_05 GBRuns~109 tok/s
StarCoder2 3B3BQ4_K_M3.5 GBRuns~156 tok/s
Phi-3 Mini 3.8B3.8BQ8_05.8 GBRuns~94 tok/s
Phi-4 Mini 3.8B3.8BQ4_K_M4.5 GBRuns~121 tok/s
Gemma 3 4B4BQ4_K_M5 GBRuns~109 tok/s
Gemma 3n E4B4BQ4_K_M4.5 GBRuns~121 tok/s
Gemma 4 E4B4BQ4_K_M6 GBRuns~91 tok/s
Qwen 3 4B4BQ4_K_M4.5 GBRuns~121 tok/s
Qwen 3.5 4B4BQ4_K_M4.5 GBRuns~121 tok/s
Yi 1.5 6B6BQ4_K_M5 GBRuns~109 tok/s
Codestral Mamba 7B7BQ4_K_M6.9 GBRuns~79 tok/s
DeepSeek R1 7B7BQ8_09 GBRuns~61 tok/s
Falcon 3 7B7BQ4_K_M6.8 GBRuns~80 tok/s
InternLM 2.5 7B7BQ4_K_M5.5 GBRuns~99 tok/s
Mistral 7B7BQ8_09 GBRuns~61 tok/s
OpenChat 3.5 7B7BQ4_K_M6.9 GBRuns~79 tok/s
Qwen 2.5 7B7BQ8_09 GBRuns~61 tok/s
Qwen 2.5 Coder 7B7BQ8_09 GBRuns~61 tok/s
Qwen 2.5 VL 7B7BQ4_K_M7 GBRuns~78 tok/s
StarCoder2 7B7BQ4_K_M5.5 GBRuns~99 tok/s
WizardLM 2 7B7BQ4_K_M6.9 GBRuns~79 tok/s
Aya Expanse 8B8BQ4_K_M6.5 GBRuns~84 tok/s
Cogito 8B8BQ4_K_M7.5 GBRuns~73 tok/s
DeepSeek R1 8B8BQ4_K_M7.5 GBRuns~73 tok/s
Dolphin 3 8B8BQ4_K_M6 GBRuns~91 tok/s
Granite 3.3 8B8BQ8_010 GBRuns~55 tok/s
Llama 3.1 8B8BQ8_010 GBRuns~55 tok/s
Nemotron 3 Nano 8B8BQ4_K_M7.5 GBRuns~73 tok/s
Nous Hermes 2 8B8BQ4_K_M6 GBRuns~91 tok/s
Qwen 3 8B8BQ4_K_M7.5 GBRuns~73 tok/s
Gemma 2 9B9BQ8_011 GBRuns~50 tok/s
Qwen 3.5 9B9BQ4_K_M7.5 GBRuns~73 tok/s
Yi 1.5 9B9BQ4_K_M6.5 GBRuns~84 tok/s
Yi Coder 9B9BQ4_K_M8 GBRuns~68 tok/s
Falcon 3 10B10BQ4_K_M8.5 GBRuns~64 tok/s
Llama 3.2 Vision 11B11BQ4_K_M8.5 GBRuns~64 tok/s
Gemma 3 12B12BQ4_K_M10.5 GBRuns~52 tok/s
Mistral Nemo 12B12BQ4_K_M9.5 GBRuns~57 tok/s
DeepSeek R1 14B14BQ4_K_M9.9 GBRuns~55 tok/s
Phi-4 14B14BQ4_K_M9.9 GBRuns~55 tok/s
Phi-4 Reasoning 14B14BQ4_K_M11 GBRuns~50 tok/s
Qwen 2.5 14B14BQ4_K_M9.9 GBRuns~55 tok/s
Qwen 2.5 Coder 14B14BQ4_K_M12 GBRuns~46 tok/s
Qwen 3 14B14BQ4_K_M12 GBRuns~46 tok/s
StarCoder2 15B15BQ8_017 GBRuns~32 tok/s
InternLM 2.5 20B20BQ4_K_M12 GBRuns~46 tok/s
gpt-oss 20B21BMXFP415 GBRuns~36 tok/s
Codestral 22B22BQ4_K_M14.7 GBRuns~37 tok/s
Devstral 24B24BQ4_K_M17 GBRuns~32 tok/s
Magistral Small 24B24BQ4_K_M17 GBRuns~32 tok/s
Mistral Small 3.1 24B24BQ4_K_M18 GBRuns~30 tok/s
Gemma 4 26B26BQ4_K_M20 GBRuns~27 tok/s
Gemma 2 27B27BQ4_K_M17.7 GBRuns~31 tok/s
Gemma 3 27B27BQ4_K_M20 GBRuns~27 tok/s
Qwen 3.5 27B27BQ4_K_M19 GBRuns~29 tok/s
Qwen 3.6 27B27BQ4_K_M20 GBRuns~27 tok/s
Qwen 3 30B-A3B (MoE)30BQ4_K_M22 GBRuns~25 tok/s
Gemma 4 31B31BQ4_K_M22 GBRuns~25 tok/s
Aya Expanse 32B32BQ4_K_M22 GBRuns~25 tok/s
Cogito 32B32BQ4_K_M21.5 GBRuns~25 tok/s
DeepSeek R1 32B32BQ4_K_M20.7 GBRuns~26 tok/s
Qwen 2.5 32B32BQ4_K_M20.7 GBRuns~26 tok/s
Qwen 2.5 Coder 32B32BQ4_K_M23 GBRuns~24 tok/s
Qwen 3 32B32BQ4_K_M23 GBRuns~24 tok/s
QwQ 32B32BQ4_K_M21.5 GBRuns~25 tok/s
Laguna XS 2.133BQ4_K_M22 GBRuns~25 tok/s
WizardCoder 33B33BQ4_K_M22 GBRuns~25 tok/s
Nous Hermes 2 34B34BQ4_K_M19 GBRuns~29 tok/s
Yi 1.5 34B34BQ4_K_M21 GBRuns~26 tok/s
Command R 35B35BQ4_K_M22.5 GBRuns~24 tok/s
Qwen 3.5 35B A3B35BQ4_K_M12 GBRuns~46 tok/s
Qwen 3.6 35B-A3B35BQ4_K_M27 GBRuns~20 tok/s
Dolphin Mixtral 8x7B47BQ4_K_M26 GBRuns~21 tok/s
Mixtral 8x7B47BQ4_K_M29.7 GBRuns~18 tok/s
Cogito 70B70BQ4_K_M43 GBRuns~13 tok/s
DeepSeek R1 70B70BQ4_K_M43.5 GBRuns~13 tok/s
Llama 3.1 70B70BQ4_K_M43.5 GBRuns~13 tok/s
Llama 3.3 70B70BQ4_K_M43.5 GBRuns~13 tok/s
Qwen 2.5 72B72BQ4_K_M44.7 GBRuns~12 tok/s
Qwen 2.5 VL 72B72BQ4_K_M41 GBRuns~13 tok/s
Llama 3.2 Vision 90B90BQ4_K_M50 GBRuns~11 tok/s
Command R+ 104B104BQ4_K_M57 GBRuns~10 tok/s
Llama 4 Scout (109B/17B active)109BQ4_K_M72 GBRuns~8 tok/s
Command A 111B111BQ4_K_M61 GBRuns~9 tok/s
gpt-oss 120B117BMXFP470 GBRuns~8 tok/s
Qwen 3.5 122B122BQ4_K_M85 GBRuns~6 tok/s
Devstral 2 123B123BQ4_K_M67 GBRuns~8 tok/s
Mistral Large 2 123B123BQ4_K_M67 GBRuns~8 tok/s
Mixtral 8x22B141BQ4_K_M86 GBRuns~6 tok/s
Qwen 3 235B-A22B235BQ4_K_M138 GBCPU Offload~1 tok/s
Nemotron Ultra 253B253BQ4_K_M155 GBCPU Offload~1 tok/s
MiniMax M3428BQ2_K163 GBCPU Offload~1 tok/s
12 model(s) are too large for this hardware.