DeepSeek R1 Distill Qwen 32B needs about 20.16 GB at Q4_K_M with 8K context.
DeepSeek R1 Distill Qwen 32B is a distilled reasoning file on a Qwen-shaped stack, published by DeepSeek under MIT in January. It is not a Qwen-org release. A sliding-window number is present and ignored, so the cache uses the full context on all 64 layers.
The configured maximum is 131,072 tokens, which makes this the long-context member of the 32B-shaped group. Q4_K_M at 8,192 tokens is 20.16 GB. The smallest listed GPU that still leaves 10 percent free is GeForce RTX 3090 24GB, with 3.84 GB left.
40 query heads and 8 key heads. No experts and no image encoder. QwQ is the Apache reasoning file with a shorter maximum.
Qwen2.5 Coder is the code file with a 32,768 cap.
Which GPUs fit
| GPU | Memory | Status | Headroom |
|---|---|---|---|
| NVIDIA A100 80GB80 GB · No CPU offload | 80 GB | Fits+15.97 GB | +15.97 GB |
| NVIDIA H100 SXM 80GB80 GB · No CPU offload | 80 GB | Fits+15.97 GB | +15.97 GB |
| GeForce RTX 3060 12GB12 GB · Won't fit | 12 GB | 52.03 GB short | Won't fit |
| GeForce RTX 3070 8GB8 GB · Won't fit | 8 GB | 56.03 GB short | Won't fit |
| GeForce RTX 3080 10GB10 GB · Won't fit | 10 GB | 54.03 GB short | Won't fit |
| GeForce RTX 3090 24GB24 GB · CPU offload | 24 GB | 40.03 GB short | CPU offload |
| GeForce RTX 4060 8GB8 GB · Won't fit | 8 GB | 56.03 GB short | Won't fit |
| GeForce RTX 4060 Ti 16GB16 GB · CPU offload | 16 GB | 48.03 GB short | CPU offload |
| GeForce RTX 4070 12GB12 GB · Won't fit | 12 GB | 52.03 GB short | Won't fit |
| GeForce RTX 4070 Ti Super 16GB16 GB · CPU offload | 16 GB | 48.03 GB short | CPU offload |
| GeForce RTX 4080 16GB16 GB · CPU offload | 16 GB | 48.03 GB short | CPU offload |
| GeForce RTX 4090 24GB24 GB · CPU offload | 24 GB | 40.03 GB short | CPU offload |
| GeForce RTX 5060 Ti 16GB16 GB · CPU offload | 16 GB | 48.03 GB short | CPU offload |
| GeForce RTX 5070 12GB12 GB · Won't fit | 12 GB | 52.03 GB short | Won't fit |
| GeForce RTX 5070 Ti 16GB16 GB · CPU offload | 16 GB | 48.03 GB short | CPU offload |
| GeForce RTX 5080 16GB16 GB · CPU offload | 16 GB | 48.03 GB short | CPU offload |
| GeForce RTX 5090 32GB32 GB · CPU offload | 32 GB | 32.03 GB short | CPU offload |
| Radeon RX 7900 XTX 24GB24 GB · CPU offload | 24 GB | 40.03 GB short | CPU offload |
| Radeon RX 9070 XT 16GB16 GB · CPU offload | 16 GB | 48.03 GB short | CPU offload |
| Apple M5 Max 48GB unified48 GB · 36.00 GB usable · CPU offload | 48 GB | 28.03 GB short | CPU offload |
| GPU | Memory | Status | Headroom |
|---|---|---|---|
| NVIDIA A100 80GB80 GB · No CPU offload | 80 GB | Fits+44.58 GB | +44.58 GB |
| NVIDIA H100 SXM 80GB80 GB · No CPU offload | 80 GB | Fits+44.58 GB | +44.58 GB |
| Apple M5 Max 48GB unified48 GB · 36.00 GB usable · Tight fit | 48 GB | Tight fit+0.58 GB | +0.58 GB |
| GeForce RTX 3060 12GB12 GB · CPU offload | 12 GB | 23.42 GB short | CPU offload |
| GeForce RTX 3070 8GB8 GB · Won't fit | 8 GB | 27.42 GB short | Won't fit |
| GeForce RTX 3080 10GB10 GB · CPU offload | 10 GB | 25.42 GB short | CPU offload |
| GeForce RTX 3090 24GB24 GB · CPU offload | 24 GB | 11.42 GB short | CPU offload |
| GeForce RTX 4060 8GB8 GB · Won't fit | 8 GB | 27.42 GB short | Won't fit |
| GeForce RTX 4060 Ti 16GB16 GB · CPU offload | 16 GB | 19.42 GB short | CPU offload |
| GeForce RTX 4070 12GB12 GB · CPU offload | 12 GB | 23.42 GB short | CPU offload |
| GeForce RTX 4070 Ti Super 16GB16 GB · CPU offload | 16 GB | 19.42 GB short | CPU offload |
| GeForce RTX 4080 16GB16 GB · CPU offload | 16 GB | 19.42 GB short | CPU offload |
| GeForce RTX 4090 24GB24 GB · CPU offload | 24 GB | 11.42 GB short | CPU offload |
| GeForce RTX 5060 Ti 16GB16 GB · CPU offload | 16 GB | 19.42 GB short | CPU offload |
| GeForce RTX 5070 12GB12 GB · CPU offload | 12 GB | 23.42 GB short | CPU offload |
| GeForce RTX 5070 Ti 16GB16 GB · CPU offload | 16 GB | 19.42 GB short | CPU offload |
| GeForce RTX 5080 16GB16 GB · CPU offload | 16 GB | 19.42 GB short | CPU offload |
| GeForce RTX 5090 32GB32 GB · CPU offload | 32 GB | 3.42 GB short | CPU offload |
| Radeon RX 7900 XTX 24GB24 GB · CPU offload | 24 GB | 11.42 GB short | CPU offload |
| Radeon RX 9070 XT 16GB16 GB · CPU offload | 16 GB | 19.42 GB short | CPU offload |
| GPU | Memory | Status | Headroom |
|---|---|---|---|
| GeForce RTX 5090 32GB32 GB · No CPU offload | 32 GB | Fits+3.97 GB | +3.97 GB |
| NVIDIA A100 80GB80 GB · No CPU offload | 80 GB | Fits+51.97 GB | +51.97 GB |
| NVIDIA H100 SXM 80GB80 GB · No CPU offload | 80 GB | Fits+51.97 GB | +51.97 GB |
| Apple M5 Max 48GB unified48 GB · 36.00 GB usable · No CPU offload | 48 GB | Fits+7.97 GB | +7.97 GB |
| GeForce RTX 3060 12GB12 GB · CPU offload | 12 GB | 16.03 GB short | CPU offload |
| GeForce RTX 3070 8GB8 GB · CPU offload | 8 GB | 20.03 GB short | CPU offload |
| GeForce RTX 3080 10GB10 GB · CPU offload | 10 GB | 18.03 GB short | CPU offload |
| GeForce RTX 3090 24GB24 GB · CPU offload | 24 GB | 4.03 GB short | CPU offload |
| GeForce RTX 4060 8GB8 GB · CPU offload | 8 GB | 20.03 GB short | CPU offload |
| GeForce RTX 4060 Ti 16GB16 GB · CPU offload | 16 GB | 12.03 GB short | CPU offload |
| GeForce RTX 4070 12GB12 GB · CPU offload | 12 GB | 16.03 GB short | CPU offload |
| GeForce RTX 4070 Ti Super 16GB16 GB · CPU offload | 16 GB | 12.03 GB short | CPU offload |
| GeForce RTX 4080 16GB16 GB · CPU offload | 16 GB | 12.03 GB short | CPU offload |
| GeForce RTX 4090 24GB24 GB · CPU offload | 24 GB | 4.03 GB short | CPU offload |
| GeForce RTX 5060 Ti 16GB16 GB · CPU offload | 16 GB | 12.03 GB short | CPU offload |
| GeForce RTX 5070 12GB12 GB · CPU offload | 12 GB | 16.03 GB short | CPU offload |
| GeForce RTX 5070 Ti 16GB16 GB · CPU offload | 16 GB | 12.03 GB short | CPU offload |
| GeForce RTX 5080 16GB16 GB · CPU offload | 16 GB | 12.03 GB short | CPU offload |
| Radeon RX 7900 XTX 24GB24 GB · CPU offload | 24 GB | 4.03 GB short | CPU offload |
| Radeon RX 9070 XT 16GB16 GB · CPU offload | 16 GB | 12.03 GB short | CPU offload |
| GPU | Memory | Status | Headroom |
|---|---|---|---|
| GeForce RTX 3090 24GB24 GB · Tight fit | 24 GB | Tight fit+0.02 GB | +0.02 GB |
| GeForce RTX 4090 24GB24 GB · Tight fit | 24 GB | Tight fit+0.02 GB | +0.02 GB |
| GeForce RTX 5090 32GB32 GB · No CPU offload | 32 GB | Fits+8.02 GB | +8.02 GB |
| Radeon RX 7900 XTX 24GB24 GB · Tight fit | 24 GB | Tight fit+0.02 GB | +0.02 GB |
| NVIDIA A100 80GB80 GB · No CPU offload | 80 GB | Fits+56.02 GB | +56.02 GB |
| NVIDIA H100 SXM 80GB80 GB · No CPU offload | 80 GB | Fits+56.02 GB | +56.02 GB |
| Apple M5 Max 48GB unified48 GB · 36.00 GB usable · No CPU offload | 48 GB | Fits+12.02 GB | +12.02 GB |
| GeForce RTX 3060 12GB12 GB · CPU offload | 12 GB | 11.98 GB short | CPU offload |
| GeForce RTX 3070 8GB8 GB · CPU offload | 8 GB | 15.98 GB short | CPU offload |
| GeForce RTX 3080 10GB10 GB · CPU offload | 10 GB | 13.98 GB short | CPU offload |
| GeForce RTX 4060 8GB8 GB · CPU offload | 8 GB | 15.98 GB short | CPU offload |
| GeForce RTX 4060 Ti 16GB16 GB · CPU offload | 16 GB | 7.98 GB short | CPU offload |
| GeForce RTX 4070 12GB12 GB · CPU offload | 12 GB | 11.98 GB short | CPU offload |
| GeForce RTX 4070 Ti Super 16GB16 GB · CPU offload | 16 GB | 7.98 GB short | CPU offload |
| GeForce RTX 4080 16GB16 GB · CPU offload | 16 GB | 7.98 GB short | CPU offload |
| GeForce RTX 5060 Ti 16GB16 GB · CPU offload | 16 GB | 7.98 GB short | CPU offload |
| GeForce RTX 5070 12GB12 GB · CPU offload | 12 GB | 11.98 GB short | CPU offload |
| GeForce RTX 5070 Ti 16GB16 GB · CPU offload | 16 GB | 7.98 GB short | CPU offload |
| GeForce RTX 5080 16GB16 GB · CPU offload | 16 GB | 7.98 GB short | CPU offload |
| Radeon RX 9070 XT 16GB16 GB · CPU offload | 16 GB | 7.98 GB short | CPU offload |
| GPU | Memory | Status | Headroom |
|---|---|---|---|
| GeForce RTX 3090 24GB24 GB · No CPU offload | 24 GB | Fits+3.84 GB | +3.84 GB |
| GeForce RTX 4090 24GB24 GB · No CPU offload | 24 GB | Fits+3.84 GB | +3.84 GB |
| GeForce RTX 5090 32GB32 GB · No CPU offload | 32 GB | Fits+11.84 GB | +11.84 GB |
| Radeon RX 7900 XTX 24GB24 GB · No CPU offload | 24 GB | Fits+3.84 GB | +3.84 GB |
| NVIDIA A100 80GB80 GB · No CPU offload | 80 GB | Fits+59.84 GB | +59.84 GB |
| NVIDIA H100 SXM 80GB80 GB · No CPU offload | 80 GB | Fits+59.84 GB | +59.84 GB |
| Apple M5 Max 48GB unified48 GB · 36.00 GB usable · No CPU offload | 48 GB | Fits+15.84 GB | +15.84 GB |
| GeForce RTX 3060 12GB12 GB · CPU offload | 12 GB | 8.16 GB short | CPU offload |
| GeForce RTX 3070 8GB8 GB · CPU offload | 8 GB | 12.16 GB short | CPU offload |
| GeForce RTX 3080 10GB10 GB · CPU offload | 10 GB | 10.16 GB short | CPU offload |
| GeForce RTX 4060 8GB8 GB · CPU offload | 8 GB | 12.16 GB short | CPU offload |
| GeForce RTX 4060 Ti 16GB16 GB · CPU offload | 16 GB | 4.16 GB short | CPU offload |
| GeForce RTX 4070 12GB12 GB · CPU offload | 12 GB | 8.16 GB short | CPU offload |
| GeForce RTX 4070 Ti Super 16GB16 GB · CPU offload | 16 GB | 4.16 GB short | CPU offload |
| GeForce RTX 4080 16GB16 GB · CPU offload | 16 GB | 4.16 GB short | CPU offload |
| GeForce RTX 5060 Ti 16GB16 GB · CPU offload | 16 GB | 4.16 GB short | CPU offload |
| GeForce RTX 5070 12GB12 GB · CPU offload | 12 GB | 8.16 GB short | CPU offload |
| GeForce RTX 5070 Ti 16GB16 GB · CPU offload | 16 GB | 4.16 GB short | CPU offload |
| GeForce RTX 5080 16GB16 GB · CPU offload | 16 GB | 4.16 GB short | CPU offload |
| Radeon RX 9070 XT 16GB16 GB · CPU offload | 16 GB | 4.16 GB short | CPU offload |
| GPU | Memory | Status | Headroom |
|---|---|---|---|
| GeForce RTX 3090 24GB24 GB · No CPU offload | 24 GB | Fits+7.89 GB | +7.89 GB |
| GeForce RTX 4090 24GB24 GB · No CPU offload | 24 GB | Fits+7.89 GB | +7.89 GB |
| GeForce RTX 5090 32GB32 GB · No CPU offload | 32 GB | Fits+15.89 GB | +15.89 GB |
| Radeon RX 7900 XTX 24GB24 GB · No CPU offload | 24 GB | Fits+7.89 GB | +7.89 GB |
| NVIDIA A100 80GB80 GB · No CPU offload | 80 GB | Fits+63.89 GB | +63.89 GB |
| NVIDIA H100 SXM 80GB80 GB · No CPU offload | 80 GB | Fits+63.89 GB | +63.89 GB |
| Apple M5 Max 48GB unified48 GB · 36.00 GB usable · No CPU offload | 48 GB | Fits+19.89 GB | +19.89 GB |
| GeForce RTX 3060 12GB12 GB · CPU offload | 12 GB | 4.11 GB short | CPU offload |
| GeForce RTX 3070 8GB8 GB · CPU offload | 8 GB | 8.11 GB short | CPU offload |
| GeForce RTX 3080 10GB10 GB · CPU offload | 10 GB | 6.11 GB short | CPU offload |
| GeForce RTX 4060 8GB8 GB · CPU offload | 8 GB | 8.11 GB short | CPU offload |
| GeForce RTX 4060 Ti 16GB16 GB · CPU offload | 16 GB | 0.11 GB short | CPU offload |
| GeForce RTX 4070 12GB12 GB · CPU offload | 12 GB | 4.11 GB short | CPU offload |
| GeForce RTX 4070 Ti Super 16GB16 GB · CPU offload | 16 GB | 0.11 GB short | CPU offload |
| GeForce RTX 4080 16GB16 GB · CPU offload | 16 GB | 0.11 GB short | CPU offload |
| GeForce RTX 5060 Ti 16GB16 GB · CPU offload | 16 GB | 0.11 GB short | CPU offload |
| GeForce RTX 5070 12GB12 GB · CPU offload | 12 GB | 4.11 GB short | CPU offload |
| GeForce RTX 5070 Ti 16GB16 GB · CPU offload | 16 GB | 0.11 GB short | CPU offload |
| GeForce RTX 5080 16GB16 GB · CPU offload | 16 GB | 0.11 GB short | CPU offload |
| Radeon RX 9070 XT 16GB16 GB · CPU offload | 16 GB | 0.11 GB short | CPU offload |
| GPU | Memory | Status | Headroom |
|---|---|---|---|
| GeForce RTX 3090 24GB24 GB · No CPU offload | 24 GB | Fits+10.99 GB | +10.99 GB |
| GeForce RTX 4060 Ti 16GB16 GB · No CPU offload | 16 GB | Fits+2.99 GB | +2.99 GB |
| GeForce RTX 4070 Ti Super 16GB16 GB · No CPU offload | 16 GB | Fits+2.99 GB | +2.99 GB |
| GeForce RTX 4080 16GB16 GB · No CPU offload | 16 GB | Fits+2.99 GB | +2.99 GB |
| GeForce RTX 4090 24GB24 GB · No CPU offload | 24 GB | Fits+10.99 GB | +10.99 GB |
| GeForce RTX 5060 Ti 16GB16 GB · No CPU offload | 16 GB | Fits+2.99 GB | +2.99 GB |
| GeForce RTX 5070 Ti 16GB16 GB · No CPU offload | 16 GB | Fits+2.99 GB | +2.99 GB |
| GeForce RTX 5080 16GB16 GB · No CPU offload | 16 GB | Fits+2.99 GB | +2.99 GB |
| GeForce RTX 5090 32GB32 GB · No CPU offload | 32 GB | Fits+18.99 GB | +18.99 GB |
| Radeon RX 7900 XTX 24GB24 GB · No CPU offload | 24 GB | Fits+10.99 GB | +10.99 GB |
| Radeon RX 9070 XT 16GB16 GB · No CPU offload | 16 GB | Fits+2.99 GB | +2.99 GB |
| NVIDIA A100 80GB80 GB · No CPU offload | 80 GB | Fits+66.99 GB | +66.99 GB |
| NVIDIA H100 SXM 80GB80 GB · No CPU offload | 80 GB | Fits+66.99 GB | +66.99 GB |
| Apple M5 Max 48GB unified48 GB · 36.00 GB usable · No CPU offload | 48 GB | Fits+22.99 GB | +22.99 GB |
| GeForce RTX 3060 12GB12 GB · CPU offload | 12 GB | 1.01 GB short | CPU offload |
| GeForce RTX 3070 8GB8 GB · CPU offload | 8 GB | 5.01 GB short | CPU offload |
| GeForce RTX 3080 10GB10 GB · CPU offload | 10 GB | 3.01 GB short | CPU offload |
| GeForce RTX 4060 8GB8 GB · CPU offload | 8 GB | 5.01 GB short | CPU offload |
| GeForce RTX 4070 12GB12 GB · CPU offload | 12 GB | 1.01 GB short | CPU offload |
| GeForce RTX 5070 12GB12 GB · CPU offload | 12 GB | 1.01 GB short | CPU offload |
VRAM by quantization
Totals at 8,192 tokens. Q4_K_M is the usual balance of size and quality. FP16 weights are the parameter count times 2 bytes. The FP16 column in the table is the full estimate: weights, cache, and 1 GB.
| Quantization | Bits | Weights | Cache | Overhead | Total |
|---|---|---|---|---|---|
| FP16/BF16Bits 16 · Cache 2.00 · Overhead 1.00 | 16 | 61.03 | 2.00 | 1.00 | 64.03 |
| Q8_0Bits 8.5 · Cache 2.00 · Overhead 1.00 | 8.5 | 32.42 | 2.00 | 1.00 | 35.42 |
| Q6_KBits 6.5625 · Cache 2.00 · Overhead 1.00 | 6.5625 | 25.03 | 2.00 | 1.00 | 28.03 |
| Q5_K_MBits 5.5 · Cache 2.00 · Overhead 1.00 | 5.5 | 20.98 | 2.00 | 1.00 | 23.98 |
| Q4_K_MBits 4.5 · Cache 2.00 · Overhead 1.00 | 4.5 | 17.16 | 2.00 | 1.00 | 20.16 |
| Q3_K_MBits 3.4375 · Cache 2.00 · Overhead 1.00 | 3.4375 | 13.11 | 2.00 | 1.00 | 16.11 |
| Q2_KBits 2.625 · Cache 2.00 · Overhead 1.00 | 2.625 | 10.01 | 2.00 | 1.00 | 13.01 |
Context length
Q4_K_M total as the context changes. Cache is the part that grows.
| Context tokens | Cache GB | Q4_K_M total | FP16 total |
|---|---|---|---|
| 2048FP16 total 62.53 | 0.50 | 18.66 | 62.53 |
| 8192FP16 total 64.03 | 2.00 | 20.16 | 64.03 |
| 32768FP16 total 70.03 | 8.00 | 26.16 | 70.03 |
| 131072FP16 total 94.03 | 32.00 | 50.16 | 94.03 |
DeepSeek R1 Distill Qwen 32B hardware notes
- Unified memory counts 75 percent of the listed pool as usable. Discrete cards use the full listed memory. The memory column still shows the listed figure.
- Last updated 2025-02-24.
- Weights, cache, and the 1 GB overhead are estimates. How this is calculated.
- Architecture numbers and the parameter count come from the public model record, checked 2026-10-10.
DeepSeek R1 Distill Qwen 32B VRAM FAQ
How much VRAM does DeepSeek R1 Distill Qwen 32B need at Q4_K_M?
20.16 GB at 8,192 tokens. Weights are 17.16 GB, the cache is 2.00 GB, and overhead is 1 GB.
Does a 24 GB GPU fit DeepSeek R1 Distill Qwen 32B at Q4_K_M?
GeForce RTX 3090 24GB is Fits, 3.84 GB left. The quant table uses 8,192 tokens, the smaller of 8,192 and the configured maximum of 131,072.
What context length is configured for DeepSeek R1 Distill Qwen 32B?
The configured context length is 131,072 tokens. The quant table uses 8,192 tokens, the smaller of 8,192 and the configured maximum of 131,072.
Which source supplies the parameter count for DeepSeek R1 Distill Qwen 32B?
32.76B parameters, from the Hugging Face model record for deepseek-ai/DeepSeek-R1-Distill-Qwen-32B.
Related models
| Model | Q4_K_M GB |
|---|---|
| DeepSeek R1 | 360.1 |
| DeepSeek V3 | 360.1 |
| Gemma 4 | 18.48 |
| gpt-oss-20b | 12.15 |
| Llama 3 8B | 6.21 |
| Llama 3.1 8B | 6.21 |