Skip to content

AMD Radeon RX 9060 XT 8GB

AMD · 8GBGDDR6 · Can run 57 models

BuyAmazon
ManufacturerAMD
VRAM8 GB
Memory TypeGDDR6
ArchitectureRDNA 4
Stream Procs2,048
Bandwidth269 GB/s
TDP150W
MSRP$279
ReleasedJun 5, 2025

AI Notes

The RX 9060 XT 8GB is a budget-friendly RDNA 4 card with enough VRAM to handle 7B models comfortably at Q4 quantization. The halved memory bandwidth compared to the 16GB variant limits throughput on larger workloads. ROCm support continues to improve for RDNA 4, but NVIDIA remains easier to set up for AI inference.

Compatible Models

ModelParametersBest QuantVRAM UsedFitEst. Speed
Qwen 3 0.6B600MQ4_K_M2.5 GBRuns~108 tok/s
Qwen 3.5 0.8B800MQ4_K_M1.5 GBRuns~179 tok/s
Gemma 3 1B1BQ8_02 GBRuns~135 tok/s
Llama 3.2 1B1BQ8_03 GBRuns~90 tok/s
DeepSeek R1 1.5B1.5BQ8_03 GBRuns~90 tok/s
SmolLM2 1.7B1.7BQ8_02.7 GBRuns~100 tok/s
Gemma 2 2B2BQ8_04 GBRuns~67 tok/s
Gemma 3n E2B2BQ4_K_M3.3 GBRuns~82 tok/s
Gemma 4 E2B2BQ4_K_M4 GBRuns~67 tok/s
Qwen 3.5 2B2BQ4_K_M3 GBRuns~90 tok/s
Llama 3.2 3B3BQ8_05 GBRuns~54 tok/s
StarCoder2 3B3BQ4_K_M3.5 GBRuns~77 tok/s
Phi-3 Mini 3.8B3.8BQ8_05.8 GBRuns~46 tok/s
Phi-4 Mini 3.8B3.8BQ4_K_M4.5 GBRuns~60 tok/s
Gemma 3 4B4BQ4_K_M5 GBRuns~54 tok/s
Gemma 3n E4B4BQ4_K_M4.5 GBRuns~60 tok/s
Gemma 4 E4B4BQ4_K_M6 GBRuns~45 tok/s
Qwen 3 4B4BQ4_K_M4.5 GBRuns~60 tok/s
Qwen 3.5 4B4BQ4_K_M4.5 GBRuns~60 tok/s
Yi 1.5 6B6BQ4_K_M5 GBRuns~54 tok/s
Falcon 3 7B7BQ4_K_M6.8 GBRuns~40 tok/s
InternLM 2.5 7B7BQ4_K_M5.5 GBRuns~49 tok/s
StarCoder2 7B7BQ4_K_M5.5 GBRuns~49 tok/s
Aya Expanse 8B8BQ4_K_M6.5 GBRuns~41 tok/s
Dolphin 3 8B8BQ4_K_M6 GBRuns~45 tok/s
Nous Hermes 2 8B8BQ4_K_M6 GBRuns~45 tok/s
Yi 1.5 9B9BQ4_K_M6.5 GBRuns~41 tok/s
Codestral Mamba 7B7BQ4_K_M6.9 GBRuns (tight)~39 tok/s
OpenChat 3.5 7B7BQ4_K_M6.9 GBRuns (tight)~39 tok/s
Qwen 2.5 VL 7B7BQ4_K_M7 GBRuns (tight)~38 tok/s
WizardLM 2 7B7BQ4_K_M6.9 GBRuns (tight)~39 tok/s
Cogito 8B8BQ4_K_M7.5 GBRuns (tight)~36 tok/s
DeepSeek R1 8B8BQ4_K_M7.5 GBRuns (tight)~36 tok/s
Nemotron 3 Nano 8B8BQ4_K_M7.5 GBRuns (tight)~36 tok/s
Qwen 3 8B8BQ4_K_M7.5 GBRuns (tight)~36 tok/s
Qwen 3.5 9B9BQ4_K_M7.5 GBRuns (tight)~36 tok/s
DeepSeek R1 7B7BQ8_09 GBCPU Offload~9 tok/s
Mistral 7B7BQ8_09 GBCPU Offload~9 tok/s
Qwen 2.5 7B7BQ8_09 GBCPU Offload~9 tok/s
Qwen 2.5 Coder 7B7BQ8_09 GBCPU Offload~9 tok/s
Granite 3.3 8B8BQ8_010 GBCPU Offload~8 tok/s
Llama 3.1 8B8BQ8_010 GBCPU Offload~8 tok/s
Gemma 2 9B9BQ8_011 GBCPU Offload~7 tok/s
Yi Coder 9B9BQ4_K_M8 GBCPU Offload~10 tok/s
Falcon 3 10B10BQ4_K_M8.5 GBCPU Offload~10 tok/s
Llama 3.2 Vision 11B11BQ4_K_M8.5 GBCPU Offload~10 tok/s
Gemma 3 12B12BQ4_K_M10.5 GBCPU Offload~8 tok/s
Mistral Nemo 12B12BQ4_K_M9.5 GBCPU Offload~8 tok/s
DeepSeek R1 14B14BQ4_K_M9.9 GBCPU Offload~8 tok/s
Phi-4 14B14BQ4_K_M9.9 GBCPU Offload~8 tok/s
Phi-4 Reasoning 14B14BQ4_K_M11 GBCPU Offload~7 tok/s
Qwen 2.5 14B14BQ4_K_M9.9 GBCPU Offload~8 tok/s
Qwen 2.5 Coder 14B14BQ4_K_M12 GBCPU Offload~7 tok/s
Qwen 3 14B14BQ4_K_M12 GBCPU Offload~7 tok/s
StarCoder2 15B15BQ4_K_M10.5 GBCPU Offload~8 tok/s
InternLM 2.5 20B20BQ4_K_M12 GBCPU Offload~7 tok/s
Qwen 3.5 35B A3B35BQ4_K_M12 GBCPU Offload~7 tok/s
57 model(s) are too large for this hardware.