Skip to main content
Can I Run It? — Hardware & Model Benchmark

Can I Run It?

Check which open-weights AI models your workstation or laptop hardware can run locally across GGUF quantization levels.

YOUR HARDWARE

16 GB unified memory available. You can run 11 of 16 models at Q4_K_M.
BEST FOR YOURUNS WELL 73/100

DeepSeek R1 32B

DeepSeek•32B params•Quality: 89/100•Best quant: Q3_K_M•~15 tok/s

32B reasoning model distilled from Qwen 32B with R1 chain-of-thought

SmolLM3 3B

HuggingFace
RUNS WELL 73/100

Lightweight multilingual reasoning model for edge hardware

3B params•128K ctx•Apache 2.0•~34 tok/s
CHATREASONINGEDGE
QUANTIZATION / VRAMBest: F16
Q2_K
1GB
Q3
1.4GB
Q4
1.9GB
Q5
2.3GB
Q6_K
2.7GB
Q8_0
3.3GB
F16
6.6GB
Recommended: F16 (6.6 GB)

Llama 3.2 3B

Meta
RUNS WELL 73/100

Lightweight Llama model optimized for mobile and edge devices

3B params•128K ctx•Llama 3.2•~34 tok/s
CHATCODE
QUANTIZATION / VRAMBest: F16
Q2_K
1GB
Q3
1.4GB
Q4
1.9GB
Q5
2.3GB
Q6_K
2.7GB
Q8_0
3.3GB
F16
6.6GB
Recommended: F16 (6.6 GB)

Qwen 3.5 2B

Alibaba
RUNS WELL 73/100

Small multimodal Qwen 3.5 model with ultra-fast generation

2B params•32K ctx•Apache 2.0•~51 tok/s
CHATMULTILINGUAL
QUANTIZATION / VRAMBest: F16
Q2_K
0.7GB
Q3
1GB
Q4
1.2GB
Q5
1.5GB
Q6_K
1.8GB
Q8_0
2.2GB
F16
4.4GB
Recommended: F16 (4.4 GB)

DeepSeek R1 1.5B

DeepSeek
RUNS WELL 73/100

Compact reasoning model distilled from DeepSeek-R1

1.5B params•128K ctx•MIT•~68 tok/s
REASONINGCODE
QUANTIZATION / VRAMBest: F16
Q2_K
0.6GB
Q3
0.8GB
Q4
1.1GB
Q5
1.3GB
Q6_K
1.5GB
Q8_0
1.8GB
F16
3.3GB
Recommended: F16 (3.3 GB)

Qwen 3.5 9B

Alibaba
RUNS WELL 73/100

Multimodal Qwen 3.5 mid-size model for general reasoning and code

9B params•128K ctx•Apache 2.0•~23 tok/s
CHATCODEVISIONMULTIMODAL
QUANTIZATION / VRAMBest: Q8_0
Q2_K
2.8GB
Q3
4.1GB
Q4
5.4GB
Q5
6.6GB
Q6_K
7.8GB
Q8_0
9.8GB
F16
19.2GB
Recommended: Q8_0 (9.8 GB)

Llama 3.1 8B

Meta
RUNS WELL 73/100

State-of-the-art 8B open model for chat, coding, and function calling

8B params•128K ctx•Llama 3.1•~26 tok/s
CHATCODEAGENTIC
QUANTIZATION / VRAMBest: Q8_0
Q2_K
2.6GB
Q3
3.7GB
Q4
4.9GB
Q5
5.9GB
Q6_K
7GB
Q8_0
8.8GB
F16
17.2GB
Recommended: Q8_0 (8.8 GB)

Qwen 2.5 Coder 7B

Alibaba
RUNS WELL 73/100

Specialized code generation model with impressive benchmark performance

7B params•128K ctx•Apache 2.0•~15 tok/s
CODEAGENTIC
QUANTIZATION / VRAMBest: F16
Q2_K
2.3GB
Q3
3.3GB
Q4
4.4GB
Q5
5.3GB
Q6_K
6.2GB
Q8_0
7.8GB
F16
15.2GB
Recommended: F16 (15.2 GB)

DeepSeek R1 14B

DeepSeek
RUNS WELL 73/100

Mid-size reasoning distilled model with chain-of-thought capabilities

14B params•128K ctx•MIT•~15 tok/s
REASONINGCODEAGENTIC
QUANTIZATION / VRAMBest: Q8_0
Q2_K
4.5GB
Q3
6.4GB
Q4
8.5GB
Q5
10.2GB
Q6_K
12.1GB
Q8_0
15.1GB
F16
29.5GB
Recommended: Q8_0 (15.1 GB)

Gemma 2 9B

Google
RUNS WELL 73/100

Google's 9B open model with high math and reasoning density

9B params•8K ctx•Gemma License•~23 tok/s
CHATREASONING
QUANTIZATION / VRAMBest: Q8_0
Q2_K
2.9GB
Q3
4.2GB
Q4
5.5GB
Q5
6.7GB
Q6_K
7.9GB
Q8_0
9.9GB
F16
19.5GB
Recommended: Q8_0 (9.9 GB)

Mistral 7B v0.3

Mistral AI
RUNS WELL 73/100

Classic open-weights model with function calling and sliding window attention

7B params•32K ctx•Apache 2.0•~15 tok/s
CHATCODERAG
QUANTIZATION / VRAMBest: F16
Q2_K
2.3GB
Q3
3.3GB
Q4
4.3GB
Q5
5.2GB
Q6_K
6.1GB
Q8_0
7.7GB
F16
15GB
Recommended: F16 (15 GB)

Phi-3.5 Mini 3.8B

Microsoft
RUNS WELL 73/100

Highly optimized 3.8B model for long-context comprehension and logic

3.8B params•128K ctx•MIT•~27 tok/s
REASONINGCODE
QUANTIZATION / VRAMBest: F16
Q2_K
1.3GB
Q3
1.8GB
Q4
2.4GB
Q5
2.9GB
Q6_K
3.4GB
Q8_0
4.2GB
F16
8.2GB
Recommended: F16 (8.2 GB)

Qwen 2.5 Coder 32B

Alibaba
RUNS WELL 73/100

Frontier 32B code model matching Sonnet 3.5 in coding benchmarks

32B params•128K ctx•Apache 2.0•~15 tok/s
CODEAGENTICREASONING
QUANTIZATION / VRAMBest: Q3_K_M
Q2_K
10.2GB
Q3
14.6GB
Q4
19.4GB
Q5
23.5GB
Q6_K
27.6GB
Q8_0
34.5GB
F16
68GB
Recommended: Q3_K_M (14.6 GB)

DeepSeek R1 32B

DeepSeek
RUNS WELL 73/100

32B reasoning model distilled from Qwen 32B with R1 chain-of-thought

32B params•128K ctx•MIT•~15 tok/s
REASONINGCODE
QUANTIZATION / VRAMBest: Q3_K_M
Q2_K
10.2GB
Q3
14.6GB
Q4
19.4GB
Q5
23.5GB
Q6_K
27.6GB
Q8_0
34.5GB
F16
68GB
Recommended: Q3_K_M (14.6 GB)

Mixtral 8x7B 47B

Mistral AI
RUNS WELL 73/100

Sparse Mixture-of-Experts architecture (8x7B params, 13B active)

47B params (MoE)•32K ctx•Apache 2.0•~15 tok/s
CHATCODEMULTILINGUAL
QUANTIZATION / VRAMBest: Q2_K
Q2_K
15.1GB
Q3
21.5GB
Q4
28.4GB
Q5
34.2GB
Q6_K
40.1GB
Q8_0
50.2GB
F16
98GB
Recommended: Q2_K (15.1 GB)

Llama 3.3 70B

Meta
OOM / NO FIT

Meta's flagship 70B open weight model for enterprise agentic intelligence

70B params•128K ctx•Llama 3.3
CHATCODEREASONINGAGENTIC
QUANTIZATION / VRAMBest: Q4_K_M
Q2_K
22.5GB
Q3
32.1GB
Q4
42.5GB
Q5
51.5GB
Q6_K
60.5GB
Q8_0
75.5GB
F16
148GB
Recommended: Q4_K_M (42.5 GB)

DeepSeek R1 70B

DeepSeek
OOM / NO FIT

70B reasoning powerhouse distilled from Llama 70B

70B params•128K ctx•MIT
REASONINGCODEAGENTIC
QUANTIZATION / VRAMBest: Q4_K_M
Q2_K
22.5GB
Q3
32.1GB
Q4
42.5GB
Q5
51.5GB
Q6_K
60.5GB
Q8_0
75.5GB
F16
148GB
Recommended: Q4_K_M (42.5 GB)