Skip to content

NVIDIA GeForce RTX 3080 12GB

NVIDIA · 12GBGDDR6X · Can run 63 models

BuyAmazon
ManufacturerNVIDIA
VRAM12 GB
Memory TypeGDDR6X
ArchitectureAmpere
CUDA Cores8,960
Tensor Cores280
Bandwidth912 GB/s
TDP350W
MSRP$799
ReleasedJan 11, 2022

AI Notes

The RTX 3080 12GB is a decent option for running local AI models. With 12GB of GDDR6X VRAM, it can handle 7B models at full precision and 13B models with quantization. Its older Ampere architecture is slower per core than Ada Lovelace but still delivers solid inference performance.

Compatible Models

ModelParametersBest QuantVRAM UsedFitEst. Speed
Qwen 3 0.6B600MQ4_K_M2.5 GBRuns~365 tok/s
Qwen 3.5 0.8B800MQ4_K_M1.5 GBRuns~608 tok/s
Gemma 3 1B1BQ8_02 GBRuns~456 tok/s
Llama 3.2 1B1BQ8_03 GBRuns~304 tok/s
DeepSeek R1 1.5B1.5BQ8_03 GBRuns~304 tok/s
SmolLM2 1.7B1.7BQ8_02.7 GBRuns~338 tok/s
Gemma 2 2B2BQ8_04 GBRuns~228 tok/s
Gemma 3n E2B2BQ4_K_M3.3 GBRuns~276 tok/s
Gemma 4 E2B2BQ4_K_M4 GBRuns~228 tok/s
Qwen 3.5 2B2BQ4_K_M3 GBRuns~304 tok/s
Llama 3.2 3B3BQ8_05 GBRuns~182 tok/s
StarCoder2 3B3BQ4_K_M3.5 GBRuns~261 tok/s
Phi-3 Mini 3.8B3.8BQ8_05.8 GBRuns~157 tok/s
Phi-4 Mini 3.8B3.8BQ4_K_M4.5 GBRuns~203 tok/s
Gemma 3 4B4BQ4_K_M5 GBRuns~182 tok/s
Gemma 3n E4B4BQ4_K_M4.5 GBRuns~203 tok/s
Gemma 4 E4B4BQ4_K_M6 GBRuns~152 tok/s
Qwen 3 4B4BQ4_K_M4.5 GBRuns~203 tok/s
Qwen 3.5 4B4BQ4_K_M4.5 GBRuns~203 tok/s
Yi 1.5 6B6BQ4_K_M5 GBRuns~182 tok/s
Codestral Mamba 7B7BQ4_K_M6.9 GBRuns~132 tok/s
DeepSeek R1 7B7BQ8_09 GBRuns~101 tok/s
Falcon 3 7B7BQ4_K_M6.8 GBRuns~134 tok/s
InternLM 2.5 7B7BQ4_K_M5.5 GBRuns~166 tok/s
Mistral 7B7BQ8_09 GBRuns~101 tok/s
OpenChat 3.5 7B7BQ4_K_M6.9 GBRuns~132 tok/s
Qwen 2.5 7B7BQ8_09 GBRuns~101 tok/s
Qwen 2.5 Coder 7B7BQ8_09 GBRuns~101 tok/s
Qwen 2.5 VL 7B7BQ4_K_M7 GBRuns~130 tok/s
StarCoder2 7B7BQ4_K_M5.5 GBRuns~166 tok/s
WizardLM 2 7B7BQ4_K_M6.9 GBRuns~132 tok/s
Aya Expanse 8B8BQ4_K_M6.5 GBRuns~140 tok/s
Cogito 8B8BQ4_K_M7.5 GBRuns~122 tok/s
DeepSeek R1 8B8BQ4_K_M7.5 GBRuns~122 tok/s
Dolphin 3 8B8BQ4_K_M6 GBRuns~152 tok/s
Granite 3.3 8B8BQ8_010 GBRuns~91 tok/s
Llama 3.1 8B8BQ8_010 GBRuns~91 tok/s
Nemotron 3 Nano 8B8BQ4_K_M7.5 GBRuns~122 tok/s
Nous Hermes 2 8B8BQ4_K_M6 GBRuns~152 tok/s
Qwen 3 8B8BQ4_K_M7.5 GBRuns~122 tok/s
Qwen 3.5 9B9BQ4_K_M7.5 GBRuns~122 tok/s
Yi 1.5 9B9BQ4_K_M6.5 GBRuns~140 tok/s
Yi Coder 9B9BQ4_K_M8 GBRuns~114 tok/s
Falcon 3 10B10BQ4_K_M8.5 GBRuns~107 tok/s
Llama 3.2 Vision 11B11BQ4_K_M8.5 GBRuns~107 tok/s
Mistral Nemo 12B12BQ4_K_M9.5 GBRuns~96 tok/s
DeepSeek R1 14B14BQ4_K_M9.9 GBRuns~92 tok/s
Phi-4 14B14BQ4_K_M9.9 GBRuns~92 tok/s
Qwen 2.5 14B14BQ4_K_M9.9 GBRuns~92 tok/s
Gemma 2 9B9BQ8_011 GBRuns (tight)~83 tok/s
Gemma 3 12B12BQ4_K_M10.5 GBRuns (tight)~87 tok/s
Phi-4 Reasoning 14B14BQ4_K_M11 GBRuns (tight)~83 tok/s
Qwen 2.5 Coder 14B14BQ4_K_M12 GBCPU Offload~23 tok/s
Qwen 3 14B14BQ4_K_M12 GBCPU Offload~23 tok/s
StarCoder2 15B15BQ8_017 GBCPU Offload~16 tok/s
InternLM 2.5 20B20BQ4_K_M12 GBCPU Offload~23 tok/s
gpt-oss 20B21BMXFP415 GBCPU Offload~18 tok/s
Codestral 22B22BQ4_K_M14.7 GBCPU Offload~19 tok/s
Devstral 24B24BQ4_K_M17 GBCPU Offload~16 tok/s
Magistral Small 24B24BQ4_K_M17 GBCPU Offload~16 tok/s
Mistral Small 3.1 24B24BQ4_K_M18 GBCPU Offload~15 tok/s
Gemma 2 27B27BQ4_K_M17.7 GBCPU Offload~16 tok/s
Qwen 3.5 35B A3B35BQ4_K_M12 GBCPU Offload~23 tok/s
51 model(s) are too large for this hardware.