Skip to content

NVIDIA GeForce RTX 3080 10GB

NVIDIA · 10GBGDDR6X · Can run 59 models

BuyAmazon
ManufacturerNVIDIA
VRAM10 GB
Memory TypeGDDR6X
ArchitectureAmpere
CUDA Cores8,704
Tensor Cores272
Bandwidth760 GB/s
TDP320W
MSRP$699
ReleasedSep 17, 2020

AI Notes

The RTX 3080 10GB offers excellent bandwidth at 760 GB/s, making it one of the fastest cards for small model inference. The 10GB VRAM limits it to 7B models comfortably and 13B with aggressive quantization. Very popular on the used market for local AI workloads.

Compatible Models

ModelParametersBest QuantVRAM UsedFitEst. Speed
Qwen 3 0.6B600MQ4_K_M2.5 GBRuns~304 tok/s
Qwen 3.5 0.8B800MQ4_K_M1.5 GBRuns~507 tok/s
Gemma 3 1B1BQ8_02 GBRuns~380 tok/s
Llama 3.2 1B1BQ8_03 GBRuns~253 tok/s
DeepSeek R1 1.5B1.5BQ8_03 GBRuns~253 tok/s
SmolLM2 1.7B1.7BQ8_02.7 GBRuns~281 tok/s
Gemma 2 2B2BQ8_04 GBRuns~190 tok/s
Gemma 3n E2B2BQ4_K_M3.3 GBRuns~230 tok/s
Gemma 4 E2B2BQ4_K_M4 GBRuns~190 tok/s
Qwen 3.5 2B2BQ4_K_M3 GBRuns~253 tok/s
Llama 3.2 3B3BQ8_05 GBRuns~152 tok/s
StarCoder2 3B3BQ4_K_M3.5 GBRuns~217 tok/s
Phi-3 Mini 3.8B3.8BQ8_05.8 GBRuns~131 tok/s
Phi-4 Mini 3.8B3.8BQ4_K_M4.5 GBRuns~169 tok/s
Gemma 3 4B4BQ4_K_M5 GBRuns~152 tok/s
Gemma 3n E4B4BQ4_K_M4.5 GBRuns~169 tok/s
Gemma 4 E4B4BQ4_K_M6 GBRuns~127 tok/s
Qwen 3 4B4BQ4_K_M4.5 GBRuns~169 tok/s
Qwen 3.5 4B4BQ4_K_M4.5 GBRuns~169 tok/s
Yi 1.5 6B6BQ4_K_M5 GBRuns~152 tok/s
Codestral Mamba 7B7BQ4_K_M6.9 GBRuns~110 tok/s
Falcon 3 7B7BQ4_K_M6.8 GBRuns~112 tok/s
InternLM 2.5 7B7BQ4_K_M5.5 GBRuns~138 tok/s
OpenChat 3.5 7B7BQ4_K_M6.9 GBRuns~110 tok/s
Qwen 2.5 VL 7B7BQ4_K_M7 GBRuns~109 tok/s
StarCoder2 7B7BQ4_K_M5.5 GBRuns~138 tok/s
WizardLM 2 7B7BQ4_K_M6.9 GBRuns~110 tok/s
Aya Expanse 8B8BQ4_K_M6.5 GBRuns~117 tok/s
Cogito 8B8BQ4_K_M7.5 GBRuns~101 tok/s
DeepSeek R1 8B8BQ4_K_M7.5 GBRuns~101 tok/s
Dolphin 3 8B8BQ4_K_M6 GBRuns~127 tok/s
Nemotron 3 Nano 8B8BQ4_K_M7.5 GBRuns~101 tok/s
Nous Hermes 2 8B8BQ4_K_M6 GBRuns~127 tok/s
Qwen 3 8B8BQ4_K_M7.5 GBRuns~101 tok/s
Qwen 3.5 9B9BQ4_K_M7.5 GBRuns~101 tok/s
Yi 1.5 9B9BQ4_K_M6.5 GBRuns~117 tok/s
Yi Coder 9B9BQ4_K_M8 GBRuns~95 tok/s
Falcon 3 10B10BQ4_K_M8.5 GBRuns~89 tok/s
Llama 3.2 Vision 11B11BQ4_K_M8.5 GBRuns~89 tok/s
DeepSeek R1 7B7BQ8_09 GBRuns (tight)~84 tok/s
Mistral 7B7BQ8_09 GBRuns (tight)~84 tok/s
Qwen 2.5 7B7BQ8_09 GBRuns (tight)~84 tok/s
Qwen 2.5 Coder 7B7BQ8_09 GBRuns (tight)~84 tok/s
Mistral Nemo 12B12BQ4_K_M9.5 GBRuns (tight)~80 tok/s
Granite 3.3 8B8BQ8_010 GBCPU Offload~23 tok/s
Llama 3.1 8B8BQ8_010 GBCPU Offload~23 tok/s
Gemma 2 9B9BQ8_011 GBCPU Offload~21 tok/s
Gemma 3 12B12BQ4_K_M10.5 GBCPU Offload~22 tok/s
DeepSeek R1 14B14BQ4_K_M9.9 GBCPU Offload~23 tok/s
Phi-4 14B14BQ4_K_M9.9 GBCPU Offload~23 tok/s
Phi-4 Reasoning 14B14BQ4_K_M11 GBCPU Offload~21 tok/s
Qwen 2.5 14B14BQ4_K_M9.9 GBCPU Offload~23 tok/s
Qwen 2.5 Coder 14B14BQ4_K_M12 GBCPU Offload~19 tok/s
Qwen 3 14B14BQ4_K_M12 GBCPU Offload~19 tok/s
StarCoder2 15B15BQ4_K_M10.5 GBCPU Offload~22 tok/s
InternLM 2.5 20B20BQ4_K_M12 GBCPU Offload~19 tok/s
gpt-oss 20B21BMXFP415 GBCPU Offload~15 tok/s
Codestral 22B22BQ4_K_M14.7 GBCPU Offload~16 tok/s
Qwen 3.5 35B A3B35BQ4_K_M12 GBCPU Offload~19 tok/s
55 model(s) are too large for this hardware.