Phi-3 mini VRAM and GPU Requirements

microsoft/Phi-3-mini-4k-instruct · mit · Updated 2025-12-10

Parameters
3.82Bmodel record
Default context
4,096tokens
At Q4_K_M
3.75 GB4,096 tokens
At FP16
8.87 GBfull estimate
Smallest fit
GeForce RTX 3070 8GB10 percent free

Runs on the RTX 3070 with 4.25 GB to spare

Fits at Q4_K_M with 4,096 tokens of context, with room left for your desktop and browser.

3.75 / 8 GB

Phi-3 mini · Q4_K_M · 4,096 tokens

RTX 3070 · 8 GB

Weights

2.00 GB

params × bits ÷ 8

KV cache

0.75 GB

2 × layers × KV heads × head dim × tokens × 2 B

Overhead

1.00 GB

fixed buffers and context

Enough room to step up to Q5_K_MUses 4.20 GB, 3.80 GB to spare

Open in calculator

Phi-3 mini needs about 3.75 GB at Q4_K_M with 4,096 tokens.

Phi-3 mini 4k is the small MIT instruct model with a hard 4,096-token cap and a sliding window of 2,047, so every layer's cache stays inside that window. Created April. The files are public.

It is multi-head, not grouped-query: 32 query heads and 32 key heads across 32 layers. The feed-forward width is the narrow 8,192 size, and the vocabulary is 32,064. Because the cap is under 8,192, the quant table uses 4,096 tokens and the Q4_K_M estimate is 3.75 GB.

The smallest listed GPU that still leaves 10 percent free is GeForce RTX 3070 8GB, with 4.25 GB left. Phi-4 drops the sliding window, lengthens the maximum, and cuts the key-head count.

Which GPUs fit

Fit at FP16/BF16 and 4,096 tokens. Cards that fit in usable memory are listed first. "Short" shows how far the model goes over usable memory. Headroom uses usable memory. A unified row uses 75 percent of the listed pool.
GPU Memory Status Headroom
GeForce RTX 3060 12GB12 GB · No CPU offload 12 GB Fits+3.13 GB +3.13 GB
GeForce RTX 3080 10GB10 GB · No CPU offload 10 GB Fits+1.13 GB +1.13 GB
GeForce RTX 3090 24GB24 GB · No CPU offload 24 GB Fits+15.13 GB +15.13 GB
GeForce RTX 4060 Ti 16GB16 GB · No CPU offload 16 GB Fits+7.13 GB +7.13 GB
GeForce RTX 4070 12GB12 GB · No CPU offload 12 GB Fits+3.13 GB +3.13 GB
GeForce RTX 4070 Ti Super 16GB16 GB · No CPU offload 16 GB Fits+7.13 GB +7.13 GB
GeForce RTX 4080 16GB16 GB · No CPU offload 16 GB Fits+7.13 GB +7.13 GB
GeForce RTX 4090 24GB24 GB · No CPU offload 24 GB Fits+15.13 GB +15.13 GB
GeForce RTX 5060 Ti 16GB16 GB · No CPU offload 16 GB Fits+7.13 GB +7.13 GB
GeForce RTX 5070 12GB12 GB · No CPU offload 12 GB Fits+3.13 GB +3.13 GB
GeForce RTX 5070 Ti 16GB16 GB · No CPU offload 16 GB Fits+7.13 GB +7.13 GB
GeForce RTX 5080 16GB16 GB · No CPU offload 16 GB Fits+7.13 GB +7.13 GB
GeForce RTX 5090 32GB32 GB · No CPU offload 32 GB Fits+23.13 GB +23.13 GB
Radeon RX 7900 XTX 24GB24 GB · No CPU offload 24 GB Fits+15.13 GB +15.13 GB
Radeon RX 9070 XT 16GB16 GB · No CPU offload 16 GB Fits+7.13 GB +7.13 GB
NVIDIA A100 80GB80 GB · No CPU offload 80 GB Fits+71.13 GB +71.13 GB
NVIDIA H100 SXM 80GB80 GB · No CPU offload 80 GB Fits+71.13 GB +71.13 GB
Apple M5 Max 48GB unified48 GB · 36.00 GB usable · No CPU offload 48 GB Fits+27.13 GB +27.13 GB
GeForce RTX 3070 8GB8 GB · CPU offload 8 GB 0.87 GB short CPU offload
GeForce RTX 4060 8GB8 GB · CPU offload 8 GB 0.87 GB short CPU offload
Fit at Q8_0 and 4,096 tokens. Cards that fit in usable memory are listed first. "Short" shows how far the model goes over usable memory. Headroom uses usable memory. A unified row uses 75 percent of the listed pool.
GPU Memory Status Headroom
GeForce RTX 3060 12GB12 GB · No CPU offload 12 GB Fits+6.47 GB +6.47 GB
GeForce RTX 3070 8GB8 GB · No CPU offload 8 GB Fits+2.47 GB +2.47 GB
GeForce RTX 3080 10GB10 GB · No CPU offload 10 GB Fits+4.47 GB +4.47 GB
GeForce RTX 3090 24GB24 GB · No CPU offload 24 GB Fits+18.47 GB +18.47 GB
GeForce RTX 4060 8GB8 GB · No CPU offload 8 GB Fits+2.47 GB +2.47 GB
GeForce RTX 4060 Ti 16GB16 GB · No CPU offload 16 GB Fits+10.47 GB +10.47 GB
GeForce RTX 4070 12GB12 GB · No CPU offload 12 GB Fits+6.47 GB +6.47 GB
GeForce RTX 4070 Ti Super 16GB16 GB · No CPU offload 16 GB Fits+10.47 GB +10.47 GB
GeForce RTX 4080 16GB16 GB · No CPU offload 16 GB Fits+10.47 GB +10.47 GB
GeForce RTX 4090 24GB24 GB · No CPU offload 24 GB Fits+18.47 GB +18.47 GB
GeForce RTX 5060 Ti 16GB16 GB · No CPU offload 16 GB Fits+10.47 GB +10.47 GB
GeForce RTX 5070 12GB12 GB · No CPU offload 12 GB Fits+6.47 GB +6.47 GB
GeForce RTX 5070 Ti 16GB16 GB · No CPU offload 16 GB Fits+10.47 GB +10.47 GB
GeForce RTX 5080 16GB16 GB · No CPU offload 16 GB Fits+10.47 GB +10.47 GB
GeForce RTX 5090 32GB32 GB · No CPU offload 32 GB Fits+26.47 GB +26.47 GB
Radeon RX 7900 XTX 24GB24 GB · No CPU offload 24 GB Fits+18.47 GB +18.47 GB
Radeon RX 9070 XT 16GB16 GB · No CPU offload 16 GB Fits+10.47 GB +10.47 GB
NVIDIA A100 80GB80 GB · No CPU offload 80 GB Fits+74.47 GB +74.47 GB
NVIDIA H100 SXM 80GB80 GB · No CPU offload 80 GB Fits+74.47 GB +74.47 GB
Apple M5 Max 48GB unified48 GB · 36.00 GB usable · No CPU offload 48 GB Fits+30.47 GB +30.47 GB
Fit at Q6_K and 4,096 tokens. Cards that fit in usable memory are listed first. "Short" shows how far the model goes over usable memory. Headroom uses usable memory. A unified row uses 75 percent of the listed pool.
GPU Memory Status Headroom
GeForce RTX 3060 12GB12 GB · No CPU offload 12 GB Fits+7.33 GB +7.33 GB
GeForce RTX 3070 8GB8 GB · No CPU offload 8 GB Fits+3.33 GB +3.33 GB
GeForce RTX 3080 10GB10 GB · No CPU offload 10 GB Fits+5.33 GB +5.33 GB
GeForce RTX 3090 24GB24 GB · No CPU offload 24 GB Fits+19.33 GB +19.33 GB
GeForce RTX 4060 8GB8 GB · No CPU offload 8 GB Fits+3.33 GB +3.33 GB
GeForce RTX 4060 Ti 16GB16 GB · No CPU offload 16 GB Fits+11.33 GB +11.33 GB
GeForce RTX 4070 12GB12 GB · No CPU offload 12 GB Fits+7.33 GB +7.33 GB
GeForce RTX 4070 Ti Super 16GB16 GB · No CPU offload 16 GB Fits+11.33 GB +11.33 GB
GeForce RTX 4080 16GB16 GB · No CPU offload 16 GB Fits+11.33 GB +11.33 GB
GeForce RTX 4090 24GB24 GB · No CPU offload 24 GB Fits+19.33 GB +19.33 GB
GeForce RTX 5060 Ti 16GB16 GB · No CPU offload 16 GB Fits+11.33 GB +11.33 GB
GeForce RTX 5070 12GB12 GB · No CPU offload 12 GB Fits+7.33 GB +7.33 GB
GeForce RTX 5070 Ti 16GB16 GB · No CPU offload 16 GB Fits+11.33 GB +11.33 GB
GeForce RTX 5080 16GB16 GB · No CPU offload 16 GB Fits+11.33 GB +11.33 GB
GeForce RTX 5090 32GB32 GB · No CPU offload 32 GB Fits+27.33 GB +27.33 GB
Radeon RX 7900 XTX 24GB24 GB · No CPU offload 24 GB Fits+19.33 GB +19.33 GB
Radeon RX 9070 XT 16GB16 GB · No CPU offload 16 GB Fits+11.33 GB +11.33 GB
NVIDIA A100 80GB80 GB · No CPU offload 80 GB Fits+75.33 GB +75.33 GB
NVIDIA H100 SXM 80GB80 GB · No CPU offload 80 GB Fits+75.33 GB +75.33 GB
Apple M5 Max 48GB unified48 GB · 36.00 GB usable · No CPU offload 48 GB Fits+31.33 GB +31.33 GB
Fit at Q5_K_M and 4,096 tokens. Cards that fit in usable memory are listed first. "Short" shows how far the model goes over usable memory. Headroom uses usable memory. A unified row uses 75 percent of the listed pool.
GPU Memory Status Headroom
GeForce RTX 3060 12GB12 GB · No CPU offload 12 GB Fits+7.80 GB +7.80 GB
GeForce RTX 3070 8GB8 GB · No CPU offload 8 GB Fits+3.80 GB +3.80 GB
GeForce RTX 3080 10GB10 GB · No CPU offload 10 GB Fits+5.80 GB +5.80 GB
GeForce RTX 3090 24GB24 GB · No CPU offload 24 GB Fits+19.80 GB +19.80 GB
GeForce RTX 4060 8GB8 GB · No CPU offload 8 GB Fits+3.80 GB +3.80 GB
GeForce RTX 4060 Ti 16GB16 GB · No CPU offload 16 GB Fits+11.80 GB +11.80 GB
GeForce RTX 4070 12GB12 GB · No CPU offload 12 GB Fits+7.80 GB +7.80 GB
GeForce RTX 4070 Ti Super 16GB16 GB · No CPU offload 16 GB Fits+11.80 GB +11.80 GB
GeForce RTX 4080 16GB16 GB · No CPU offload 16 GB Fits+11.80 GB +11.80 GB
GeForce RTX 4090 24GB24 GB · No CPU offload 24 GB Fits+19.80 GB +19.80 GB
GeForce RTX 5060 Ti 16GB16 GB · No CPU offload 16 GB Fits+11.80 GB +11.80 GB
GeForce RTX 5070 12GB12 GB · No CPU offload 12 GB Fits+7.80 GB +7.80 GB
GeForce RTX 5070 Ti 16GB16 GB · No CPU offload 16 GB Fits+11.80 GB +11.80 GB
GeForce RTX 5080 16GB16 GB · No CPU offload 16 GB Fits+11.80 GB +11.80 GB
GeForce RTX 5090 32GB32 GB · No CPU offload 32 GB Fits+27.80 GB +27.80 GB
Radeon RX 7900 XTX 24GB24 GB · No CPU offload 24 GB Fits+19.80 GB +19.80 GB
Radeon RX 9070 XT 16GB16 GB · No CPU offload 16 GB Fits+11.80 GB +11.80 GB
NVIDIA A100 80GB80 GB · No CPU offload 80 GB Fits+75.80 GB +75.80 GB
NVIDIA H100 SXM 80GB80 GB · No CPU offload 80 GB Fits+75.80 GB +75.80 GB
Apple M5 Max 48GB unified48 GB · 36.00 GB usable · No CPU offload 48 GB Fits+31.80 GB +31.80 GB
Fit at Q4_K_M and 4,096 tokens. Cards that fit in usable memory are listed first. "Short" shows how far the model goes over usable memory. Headroom uses usable memory. A unified row uses 75 percent of the listed pool.
GPU Memory Status Headroom
GeForce RTX 3060 12GB12 GB · No CPU offload 12 GB Fits+8.25 GB +8.25 GB
GeForce RTX 3070 8GB8 GB · No CPU offload 8 GB Fits+4.25 GB +4.25 GB
GeForce RTX 3080 10GB10 GB · No CPU offload 10 GB Fits+6.25 GB +6.25 GB
GeForce RTX 3090 24GB24 GB · No CPU offload 24 GB Fits+20.25 GB +20.25 GB
GeForce RTX 4060 8GB8 GB · No CPU offload 8 GB Fits+4.25 GB +4.25 GB
GeForce RTX 4060 Ti 16GB16 GB · No CPU offload 16 GB Fits+12.25 GB +12.25 GB
GeForce RTX 4070 12GB12 GB · No CPU offload 12 GB Fits+8.25 GB +8.25 GB
GeForce RTX 4070 Ti Super 16GB16 GB · No CPU offload 16 GB Fits+12.25 GB +12.25 GB
GeForce RTX 4080 16GB16 GB · No CPU offload 16 GB Fits+12.25 GB +12.25 GB
GeForce RTX 4090 24GB24 GB · No CPU offload 24 GB Fits+20.25 GB +20.25 GB
GeForce RTX 5060 Ti 16GB16 GB · No CPU offload 16 GB Fits+12.25 GB +12.25 GB
GeForce RTX 5070 12GB12 GB · No CPU offload 12 GB Fits+8.25 GB +8.25 GB
GeForce RTX 5070 Ti 16GB16 GB · No CPU offload 16 GB Fits+12.25 GB +12.25 GB
GeForce RTX 5080 16GB16 GB · No CPU offload 16 GB Fits+12.25 GB +12.25 GB
GeForce RTX 5090 32GB32 GB · No CPU offload 32 GB Fits+28.25 GB +28.25 GB
Radeon RX 7900 XTX 24GB24 GB · No CPU offload 24 GB Fits+20.25 GB +20.25 GB
Radeon RX 9070 XT 16GB16 GB · No CPU offload 16 GB Fits+12.25 GB +12.25 GB
NVIDIA A100 80GB80 GB · No CPU offload 80 GB Fits+76.25 GB +76.25 GB
NVIDIA H100 SXM 80GB80 GB · No CPU offload 80 GB Fits+76.25 GB +76.25 GB
Apple M5 Max 48GB unified48 GB · 36.00 GB usable · No CPU offload 48 GB Fits+32.25 GB +32.25 GB
Fit at Q3_K_M and 4,096 tokens. Cards that fit in usable memory are listed first. "Short" shows how far the model goes over usable memory. Headroom uses usable memory. A unified row uses 75 percent of the listed pool.
GPU Memory Status Headroom
GeForce RTX 3060 12GB12 GB · No CPU offload 12 GB Fits+8.72 GB +8.72 GB
GeForce RTX 3070 8GB8 GB · No CPU offload 8 GB Fits+4.72 GB +4.72 GB
GeForce RTX 3080 10GB10 GB · No CPU offload 10 GB Fits+6.72 GB +6.72 GB
GeForce RTX 3090 24GB24 GB · No CPU offload 24 GB Fits+20.72 GB +20.72 GB
GeForce RTX 4060 8GB8 GB · No CPU offload 8 GB Fits+4.72 GB +4.72 GB
GeForce RTX 4060 Ti 16GB16 GB · No CPU offload 16 GB Fits+12.72 GB +12.72 GB
GeForce RTX 4070 12GB12 GB · No CPU offload 12 GB Fits+8.72 GB +8.72 GB
GeForce RTX 4070 Ti Super 16GB16 GB · No CPU offload 16 GB Fits+12.72 GB +12.72 GB
GeForce RTX 4080 16GB16 GB · No CPU offload 16 GB Fits+12.72 GB +12.72 GB
GeForce RTX 4090 24GB24 GB · No CPU offload 24 GB Fits+20.72 GB +20.72 GB
GeForce RTX 5060 Ti 16GB16 GB · No CPU offload 16 GB Fits+12.72 GB +12.72 GB
GeForce RTX 5070 12GB12 GB · No CPU offload 12 GB Fits+8.72 GB +8.72 GB
GeForce RTX 5070 Ti 16GB16 GB · No CPU offload 16 GB Fits+12.72 GB +12.72 GB
GeForce RTX 5080 16GB16 GB · No CPU offload 16 GB Fits+12.72 GB +12.72 GB
GeForce RTX 5090 32GB32 GB · No CPU offload 32 GB Fits+28.72 GB +28.72 GB
Radeon RX 7900 XTX 24GB24 GB · No CPU offload 24 GB Fits+20.72 GB +20.72 GB
Radeon RX 9070 XT 16GB16 GB · No CPU offload 16 GB Fits+12.72 GB +12.72 GB
NVIDIA A100 80GB80 GB · No CPU offload 80 GB Fits+76.72 GB +76.72 GB
NVIDIA H100 SXM 80GB80 GB · No CPU offload 80 GB Fits+76.72 GB +76.72 GB
Apple M5 Max 48GB unified48 GB · 36.00 GB usable · No CPU offload 48 GB Fits+32.72 GB +32.72 GB
Fit at Q2_K and 4,096 tokens. Cards that fit in usable memory are listed first. "Short" shows how far the model goes over usable memory. Headroom uses usable memory. A unified row uses 75 percent of the listed pool.
GPU Memory Status Headroom
GeForce RTX 3060 12GB12 GB · No CPU offload 12 GB Fits+9.08 GB +9.08 GB
GeForce RTX 3070 8GB8 GB · No CPU offload 8 GB Fits+5.08 GB +5.08 GB
GeForce RTX 3080 10GB10 GB · No CPU offload 10 GB Fits+7.08 GB +7.08 GB
GeForce RTX 3090 24GB24 GB · No CPU offload 24 GB Fits+21.08 GB +21.08 GB
GeForce RTX 4060 8GB8 GB · No CPU offload 8 GB Fits+5.08 GB +5.08 GB
GeForce RTX 4060 Ti 16GB16 GB · No CPU offload 16 GB Fits+13.08 GB +13.08 GB
GeForce RTX 4070 12GB12 GB · No CPU offload 12 GB Fits+9.08 GB +9.08 GB
GeForce RTX 4070 Ti Super 16GB16 GB · No CPU offload 16 GB Fits+13.08 GB +13.08 GB
GeForce RTX 4080 16GB16 GB · No CPU offload 16 GB Fits+13.08 GB +13.08 GB
GeForce RTX 4090 24GB24 GB · No CPU offload 24 GB Fits+21.08 GB +21.08 GB
GeForce RTX 5060 Ti 16GB16 GB · No CPU offload 16 GB Fits+13.08 GB +13.08 GB
GeForce RTX 5070 12GB12 GB · No CPU offload 12 GB Fits+9.08 GB +9.08 GB
GeForce RTX 5070 Ti 16GB16 GB · No CPU offload 16 GB Fits+13.08 GB +13.08 GB
GeForce RTX 5080 16GB16 GB · No CPU offload 16 GB Fits+13.08 GB +13.08 GB
GeForce RTX 5090 32GB32 GB · No CPU offload 32 GB Fits+29.08 GB +29.08 GB
Radeon RX 7900 XTX 24GB24 GB · No CPU offload 24 GB Fits+21.08 GB +21.08 GB
Radeon RX 9070 XT 16GB16 GB · No CPU offload 16 GB Fits+13.08 GB +13.08 GB
NVIDIA A100 80GB80 GB · No CPU offload 80 GB Fits+77.08 GB +77.08 GB
NVIDIA H100 SXM 80GB80 GB · No CPU offload 80 GB Fits+77.08 GB +77.08 GB
Apple M5 Max 48GB unified48 GB · 36.00 GB usable · No CPU offload 48 GB Fits+33.08 GB +33.08 GB

VRAM by quantization

Totals at 4,096 tokens. Q4_K_M is the usual balance of size and quality. FP16 weights are the parameter count times 2 bytes. The FP16 column in the table is the full estimate: weights, cache, and 1 GB.

Estimates at 4096 tokens, in GB. Formula rows apply one block size to every parameter. A published-file row uses measured weight bytes. FP16 weights equal the parameter count times 2 bytes.
Quantization Bits Weights Cache Overhead Total
FP16/BF16Bits 16 · Cache 0.75 · Overhead 1.00 16 7.12 0.75 1.00 8.87
Q8_0Bits 8.5 · Cache 0.75 · Overhead 1.00 8.5 3.78 0.75 1.00 5.53
Q6_KBits 6.5625 · Cache 0.75 · Overhead 1.00 6.5625 2.92 0.75 1.00 4.67
Q5_K_MBits 5.5 · Cache 0.75 · Overhead 1.00 5.5 2.45 0.75 1.00 4.20
Q4_K_MBits 4.5 · Cache 0.75 · Overhead 1.00 4.5 2.00 0.75 1.00 3.75
Q3_K_MBits 3.4375 · Cache 0.75 · Overhead 1.00 3.4375 1.53 0.75 1.00 3.28
Q2_KBits 2.625 · Cache 0.75 · Overhead 1.00 2.625 1.17 0.75 1.00 2.92

Context length

Q4_K_M total as the context changes. Cache is the part that grows.

  • 2,048 3.75 GB
  • 4,096 3.75 GB
Cache and totals as the context changes. Tokens above the configured maximum are not listed.
Context tokens Cache GB Q4_K_M total FP16 total
2048FP16 total 8.87 0.75 3.75 8.87
4096FP16 total 8.87 0.75 3.75 8.87

Phi-3 mini hardware notes

  • Unified memory counts 75 percent of the listed pool as usable. Discrete cards use the full listed memory. The memory column still shows the listed figure.
  • Last updated 2025-12-10.
  • Weights, cache, and the 1 GB overhead are estimates. How this is calculated.
  • Architecture numbers and the parameter count come from the public model record, checked 2026-10-10.

Phi-3 mini VRAM FAQ

How much VRAM does Phi-3 mini need at Q4_K_M?

3.75 GB at 4,096 tokens. Weights are 2.00 GB, the cache is 0.75 GB, and overhead is 1 GB.

Does a 24 GB GPU fit Phi-3 mini at Q4_K_M?

GeForce RTX 3090 24GB is Fits, 20.25 GB left. The configured maximum is 4,096 tokens, which is under 8,192, so the quant table uses 4,096 tokens.

What context length is configured for Phi-3 mini?

The configured context length is 4,096 tokens. The configured maximum is 4,096 tokens, which is under 8,192, so the quant table uses 4,096 tokens.

Which source supplies the parameter count for Phi-3 mini?

3.82B parameters, from the Hugging Face model record for microsoft/Phi-3-mini-4k-instruct.

Models in the same family, then the closest Q4_K_M totals.
Model Q4_K_M GB
Llama 3 8B 6.21
Llama 3.1 8B 6.21
gpt-oss-20b 12.15
Gemma 4 18.48