Skip to content

NVIDIA GeForce GTX 1660 Super

NVIDIA · 6GBGDDR6 · Can run 46 models

BuyAmazon
ManufacturerNVIDIA
VRAM6 GB
Memory TypeGDDR6
ArchitectureTuring
CUDA Cores1,408
Bandwidth336 GB/s
TDP125W
MSRP$229
ReleasedOct 29, 2019

AI Notes

The GTX 1660 Super's 6GB VRAM limits it to smaller 7B models with tight quantization (Q4 or lower). It lacks tensor cores, so inference speed relies entirely on CUDA throughput. Widely available used at low prices, it's a minimal entry point for experimenting with local AI on a tight budget.

Compatible Models

ModelParametersBest QuantVRAM UsedFitEst. Speed
Qwen 3 0.6B600MQ4_K_M2.5 GBRuns~134 tok/s
Qwen 3.5 0.8B800MQ4_K_M1.5 GBRuns~224 tok/s
Gemma 3 1B1BQ8_02 GBRuns~168 tok/s
Llama 3.2 1B1BQ8_03 GBRuns~112 tok/s
DeepSeek R1 1.5B1.5BQ8_03 GBRuns~112 tok/s
SmolLM2 1.7B1.7BQ8_02.7 GBRuns~124 tok/s
Gemma 2 2B2BQ8_04 GBRuns~84 tok/s
Gemma 3n E2B2BQ4_K_M3.3 GBRuns~102 tok/s
Gemma 4 E2B2BQ4_K_M4 GBRuns~84 tok/s
Qwen 3.5 2B2BQ4_K_M3 GBRuns~112 tok/s
Llama 3.2 3B3BQ8_05 GBRuns~67 tok/s
StarCoder2 3B3BQ4_K_M3.5 GBRuns~96 tok/s
Phi-4 Mini 3.8B3.8BQ4_K_M4.5 GBRuns~75 tok/s
Gemma 3 4B4BQ4_K_M5 GBRuns~67 tok/s
Gemma 3n E4B4BQ4_K_M4.5 GBRuns~75 tok/s
Qwen 3 4B4BQ4_K_M4.5 GBRuns~75 tok/s
Qwen 3.5 4B4BQ4_K_M4.5 GBRuns~75 tok/s
Yi 1.5 6B6BQ4_K_M5 GBRuns~67 tok/s
InternLM 2.5 7B7BQ4_K_M5.5 GBRuns (tight)~61 tok/s
StarCoder2 7B7BQ4_K_M5.5 GBRuns (tight)~61 tok/s
Phi-3 Mini 3.8B3.8BQ8_05.8 GBCPU Offload~17 tok/s
Gemma 4 E4B4BQ4_K_M6 GBCPU Offload~17 tok/s
Codestral Mamba 7B7BQ4_K_M6.9 GBCPU Offload~15 tok/s
DeepSeek R1 7B7BQ8_09 GBCPU Offload~11 tok/s
Falcon 3 7B7BQ4_K_M6.8 GBCPU Offload~15 tok/s
Mistral 7B7BQ8_09 GBCPU Offload~11 tok/s
OpenChat 3.5 7B7BQ4_K_M6.9 GBCPU Offload~15 tok/s
Qwen 2.5 7B7BQ8_09 GBCPU Offload~11 tok/s
Qwen 2.5 Coder 7B7BQ8_09 GBCPU Offload~11 tok/s
Qwen 2.5 VL 7B7BQ4_K_M7 GBCPU Offload~14 tok/s
WizardLM 2 7B7BQ4_K_M6.9 GBCPU Offload~15 tok/s
Aya Expanse 8B8BQ4_K_M6.5 GBCPU Offload~16 tok/s
Cogito 8B8BQ4_K_M7.5 GBCPU Offload~14 tok/s
DeepSeek R1 8B8BQ4_K_M7.5 GBCPU Offload~14 tok/s
Dolphin 3 8B8BQ4_K_M6 GBCPU Offload~17 tok/s
Granite 3.3 8B8BQ4_K_M6 GBCPU Offload~17 tok/s
Llama 3.1 8B8BQ4_K_M6.3 GBCPU Offload~16 tok/s
Nemotron 3 Nano 8B8BQ4_K_M7.5 GBCPU Offload~14 tok/s
Nous Hermes 2 8B8BQ4_K_M6 GBCPU Offload~17 tok/s
Qwen 3 8B8BQ4_K_M7.5 GBCPU Offload~14 tok/s
Gemma 2 9B9BQ4_K_M6.9 GBCPU Offload~15 tok/s
Qwen 3.5 9B9BQ4_K_M7.5 GBCPU Offload~14 tok/s
Yi 1.5 9B9BQ4_K_M6.5 GBCPU Offload~16 tok/s
Yi Coder 9B9BQ4_K_M8 GBCPU Offload~13 tok/s
Falcon 3 10B10BQ4_K_M8.5 GBCPU Offload~12 tok/s
Llama 3.2 Vision 11B11BQ4_K_M8.5 GBCPU Offload~12 tok/s
68 model(s) are too large for this hardware.