ApX 标志ApX 标志

趋近智

NVIDIA RTX PRO 4000 Blackwell SFF (24GB)

NVIDIA RTX PRO 4000 Blackwell SFF (24GB) 配备 24 GB 专用显存与 432 GB/s 显存带宽,支持 CUDA 和 TensorRT-LLM 运行环境,可进行全精度与量化大模型推理。

总显存

24 GB

可用显存上限

24 GB

显存带宽

432 GB/s

最大推理模型级别

32B 模型 (Q4)

热设计功耗

70W

显存占用随上下文长度变化曲线

随上下文长度增长的显存需求评估。当曲线超过参考线时将导致显存不足(OOM)。

DeepSeek-R1 3B (3B)Mistral-7B-v0.1 (7.3B)Magistral Small (24B)Qwen2.5-72B (72B)

量化精度:

NVIDIA RTX PRO 4000 Blackwell SFF (24GB) 最佳运行大模型与速度矩阵

主流开源大模型在 NVIDIA RTX PRO 4000 Blackwell SFF (24GB) 上的推理速度、显存兼容性与生成吞吐表现。

排序:

上下文长度:

KV 缓存:

显卡数量:

排名模型参数量量化精度预估 TPSTTFT可运行

#33

Qwen 3.8 27B

27B

INT4

22 tok/s

~3.1s

#48

Agnes 3.0 Flash

33B

INT4

19 tok/s

~3.7s

#72

K2 Horizon MoVA 36B A4B

36B (4B active)

INT4

87 tok/s

~659 ms

#83

Qwen3.5-27B

27B

INT4

22 tok/s

~3.1s

#92

Sarvam-30B

32B (2.4B active)

INT4

119 tok/s

~424 ms

#94

Qwen3.6 35B A3B

35B (3B active)

INT4

102 tok/s

~537 ms

#96

Muse Glimmer 30B

30B

INT4

20 tok/s

~3.4s

#100

Phi-4 Reasoning Plus

14B

INT4
Q8

30 tok/s

20 tok/s

~1.6s

~1.6s

#101

MiMo V2 Flash

15B (309B active)

INT4
Q8

2 tok/s

1 tok/s

~33.6s

~36.9s

#108

Gemma 4 26B A4B

25.2B (3.8B active)

INT4

98 tok/s

~555 ms

#109

Gemma 4 12B

11.95B

INT4
Q8

34 tok/s

23 tok/s

~1.4s

~1.4s

#113

Qwen3.5-9B

9B

INT4
Q8
FP16

59 tok/s

36 tok/s

18 tok/s

~1.1s

~1.1s

~1.2s

#114

Qwen3.5-35B-A3B

35B (3B active)

INT4

102 tok/s

~537 ms

#118

K2 Horizon 7B

7B

INT4
Q8
FP16

72 tok/s

44 tok/s

24 tok/s

~825 ms

~833 ms

~852 ms

#128

NVIDIA Nemotron 3 Nano 30B-A3B

3.5B (30B active)

INT4
Q8
FP16

19 tok/s

11 tok/s

6 tok/s

~3.3s

~3.3s

~3.4s

#129

Gemma 4 31B

30.7B

INT4

20 tok/s

~3.5s

#131

Nemotron 3.5 Lightning

30B (3B active)

INT4

40 tok/s

~542 ms

#132

Qwen3.5-4B

4B

INT4
Q8
FP16

108 tok/s

71 tok/s

40 tok/s

~486 ms

~491 ms

~502 ms

#133

Qwen3-30B-A3B

30B (3B active)

INT4

108 tok/s

~485 ms

#136

GPT-OSS 20B

21B (3.6B active)

INT4

47 tok/s

~531 ms

推理能力评估

不同量化精度下可运行的最大模型参数级别。

上下文长度:

4位量化

Q4

32B 模型

8位精度

Q8

14B 模型

16位全精度

FP16

8B 模型

微调能力评估

本地模型训练与适配器微调支持能力。

微调上下文:

QLoRA

4-bit

32B 模型

LoRA

16-bit

14B 模型

全参数微调

3B 模型

负载与选型建议

NVIDIA RTX PRO 4000 Blackwell SFF (24GB) 上的最佳量化精度与运行规格建议。

最佳推理区间

适合在全精度或 Q8 精度下运行 14B 模型,以及在 Q4 精度下搭配最高 32k 上下文运行 32B 模型。

显存带宽与推理速率

具备 432 GB/s 聚合带宽,单批次推理处于显存带宽受限模式。8B Q4 模型预估生成速度约 96 tok/s,70B Q4 模型预估生成速度约 11 tok/s。

常见问题解答