趋近智
NVIDIA RTX 4000 Ada Generation (20GB) 配备 20 GB 专用显存与 360 GB/s 显存带宽,支持 CUDA 和 TensorRT-LLM 运行环境,可进行全精度与量化大模型推理。
总显存
20 GB
可用显存上限
20 GB
显存带宽
360 GB/s
最大推理模型级别
14B 模型 (Q4)
热设计功耗
130W
随上下文长度增长的显存需求评估。当曲线超过参考线时将导致显存不足(OOM)。
量化精度:
主流开源大模型在 NVIDIA RTX 4000 Ada Generation (20GB) 上的推理速度、显存兼容性与生成吞吐表现。
排序:
上下文长度:
KV 缓存:
显卡数量:
| 排名 | 模型 | 参数量 | 量化精度 | 预估 TPS | TTFT | 可运行 |
|---|---|---|---|---|---|---|
#33 | Qwen 3.8 27B | 27B | INT4 | 19 tok/s | ~2.8s | |
#48 | Agnes 3.0 Flash | 33B | INT4 | 15 tok/s | ~3.7s | |
#72 | K2 Horizon MoVA 36B A4B | 36B (4B active) | INT4 | 72 tok/s | ~645 ms | |
#83 | Qwen3.5-27B | 27B | INT4 | 19 tok/s | ~2.8s | |
#92 | Sarvam-30B | 32B (2.4B active) | INT4 | 100 tok/s | ~417 ms | |
#94 | Qwen3.6 35B A3B | 35B (3B active) | INT4 | 84 tok/s | ~525 ms | |
#96 | Muse Glimmer 30B | 30B | INT4 | 16 tok/s | ~3.4s | |
#100 | Phi-4 Reasoning Plus | 14B | INT4 Q8 | 25 tok/s 16 tok/s | ~1.5s ~1.6s | |
#101 | MiMo V2 Flash | 15B (309B active) | INT4 | 2 tok/s | ~30.4s | |
#108 | Gemma 4 26B A4B | 25.2B (3.8B active) | INT4 | 86 tok/s | ~503 ms | |
#109 | Gemma 4 12B | 11.95B | INT4 Q8 | 28 tok/s 18 tok/s | ~1.3s ~1.4s | |
#113 | Qwen3.5-9B | 9B | INT4 Q8 FP16 | 50 tok/s 30 tok/s 14 tok/s | ~952 ms ~966 ms ~1.2s | |
#114 | Qwen3.5-35B-A3B | 35B (3B active) | INT4 | 84 tok/s | ~525 ms | |
#118 | K2 Horizon 7B | 7B | INT4 Q8 FP16 | 62 tok/s 38 tok/s 20 tok/s | ~747 ms ~757 ms ~780 ms | |
#128 | NVIDIA Nemotron 3 Nano 30B-A3B | 3.5B (30B active) | INT4 Q8 FP16 | 16 tok/s 9 tok/s 5 tok/s | ~3.0s ~3.0s ~3.1s | |
#129 | Gemma 4 31B | 30.7B | INT4 | 16 tok/s | ~3.4s | |
#132 | Qwen3.5-4B | 4B | INT4 Q8 FP16 | 95 tok/s 61 tok/s 34 tok/s | ~440 ms ~446 ms ~459 ms | |
#133 | Qwen3-30B-A3B | 30B (3B active) | INT4 | 90 tok/s | ~477 ms | |
#136 | GPT-OSS 20B | 21B (3.6B active) | INT4 | 38 tok/s | ~525 ms | |
#146 | Granite 4.2 8B | 8B | INT4 Q8 FP16 | 56 tok/s 34 tok/s 17 tok/s | ~848 ms ~860 ms ~961 ms | |
#150 | Gemma 4 E4B | 8B | INT4 Q8 FP16 | 56 tok/s 34 tok/s 17 tok/s | ~848 ms ~860 ms ~961 ms | |
#151 | Nemotron 3.5 Lightning 30B A3B | 30B (3B active) | INT4 | 90 tok/s | ~477 ms | |
#153 | Qwen3-32B | 32B | INT4 | 15 tok/s | ~3.6s | |
#158 | GLM-4V | 9B | INT4 Q8 | 36 tok/s 25 tok/s | ~960 ms ~973 ms | |
#159 | Gemma 3 27B | 27B | INT4 | 19 tok/s | ~2.8s | |
#160 | Phi-4 | 14B | INT4 Q8 | 34 tok/s 20 tok/s | ~1.5s ~1.5s | |
#162 | DeepSeek-R1 32B | 32B | INT4 | 16 tok/s | ~3.6s | |
#164 | Qwen2.5-32B | 32B | INT4 | 15 tok/s | ~3.6s | |
#168 | Magistral Small | 24B | INT4 | 15 tok/s | ~2.7s | |
#169 | OLMo 3 7B Think | 7B | INT4 Q8 FP16 | 44 tok/s 31 tok/s 17 tok/s | ~753 ms ~763 ms ~852 ms | |
#172 | DeepSeek-R1 14B | 14B | INT4 Q8 | 35 tok/s 20 tok/s | ~1.5s ~1.5s | |
#173 | Ministral 3 14B | 14B | INT4 Q8 | 25 tok/s 16 tok/s | ~1.5s ~1.6s | |
#177 | Gemma 3 12B | 12B | INT4 Q8 | 39 tok/s 23 tok/s | ~1.3s ~1.3s | |
#181 | Mistral-Small-2501 | 24B | INT4 | 21 tok/s | ~2.5s | |
#182 | Ministral 3 8B | 8B | INT4 Q8 FP16 | 40 tok/s 27 tok/s 14 tok/s | ~856 ms ~867 ms ~1.0s | |
#183 | Qwen3.5-2B | 2B | INT4 Q8 FP16 | 146 tok/s 102 tok/s 61 tok/s | ~237 ms ~240 ms ~246 ms | |
#184 | MiniCPM5-2B | 2B | INT4 Q8 FP16 | 146 tok/s 102 tok/s 61 tok/s | ~237 ms ~240 ms ~246 ms | |
#185 | Qwen2.5-14B | 14B | INT4 Q8 | 34 tok/s 20 tok/s | ~1.5s ~1.5s | |
#186 | Gemma 2 27B | 27B | INT4 | 19 tok/s | ~2.8s | |
#188 | Gemma 4 E2B | 5.1B | INT4 Q8 FP16 | 80 tok/s 50 tok/s 27 tok/s | ~552 ms ~560 ms ~577 ms | |
#189 | Qwen3-4B | 4B | INT4 Q8 FP16 | 95 tok/s 61 tok/s 34 tok/s | ~440 ms ~446 ms ~459 ms | |
#190 | DeepSeek-R1 8B | 8B | INT4 Q8 FP16 | 57 tok/s 34 tok/s 17 tok/s | ~848 ms ~860 ms ~960 ms | |
#193 | Ministral 3 3B | 3B | INT4 Q8 FP16 | 75 tok/s 58 tok/s 37 tok/s | ~343 ms ~347 ms ~356 ms | |
#195 | Qwen3-14B | 14B | INT4 Q8 | 34 tok/s 20 tok/s | ~1.5s ~1.5s | |
#197 | Gemma 2 9B | 9B | INT4 Q8 FP16 | 50 tok/s 30 tok/s 14 tok/s | ~952 ms ~966 ms ~1.2s | |
#198 | Qwen2.5-7B | 7B | INT4 Q8 FP16 | 62 tok/s 38 tok/s 20 tok/s | ~747 ms ~757 ms ~780 ms | |
#199 | Qwen3-8B | 8B | INT4 Q8 FP16 | 56 tok/s 34 tok/s 17 tok/s | ~848 ms ~860 ms ~961 ms | |
#200 | Gemma 3 4B | 4B | INT4 Q8 FP16 | 95 tok/s 61 tok/s 34 tok/s | ~440 ms ~446 ms ~459 ms | |
#201 | DeepSeek-R1 7B | 7B | INT4 Q8 FP16 | 64 tok/s 38 tok/s 20 tok/s | ~746 ms ~757 ms ~779 ms | |
#202 | Llama 3.1 8B | 8B | INT4 Q8 FP16 | 56 tok/s 34 tok/s 17 tok/s | ~848 ms ~860 ms ~961 ms | |
#204 | Qwen3-1.7B | 1.7B | INT4 Q8 FP16 | 160 tok/s 114 tok/s 70 tok/s | ~203 ms ~206 ms ~211 ms | |
#206 | Gemma 3 270M | 0.27B | INT4 Q8 FP16 | 273 tok/s 248 tok/s 204 tok/s | ~38 ms ~38 ms ~39 ms | |
#208 | Llama 3 8B | 8B | INT4 Q8 FP16 | 56 tok/s 34 tok/s 17 tok/s | ~848 ms ~860 ms ~961 ms | |
#209 | Qwen3-0.6B | 0.6B | INT4 Q8 FP16 | 254 tok/s 208 tok/s 148 tok/s | ~76 ms ~77 ms ~79 ms | |
#210 | Phi-4-Mini | 3.8B | INT4 Q8 FP16 | 98 tok/s 63 tok/s 35 tok/s | ~420 ms ~425 ms ~438 ms | |
#212 | Ministral-8B-2410 | 8B | INT4 Q8 FP16 | 56 tok/s 34 tok/s 17 tok/s | ~848 ms ~860 ms ~961 ms | |
#213 | DeepSeek-R1 1.5B | 1.5B | INT4 Q8 FP16 | 171 tok/s 124 tok/s 77 tok/s | ~181 ms ~183 ms ~188 ms | |
#214 | Llama 3.2 3B | 3B | INT4 Q8 FP16 | 115 tok/s 76 tok/s 44 tok/s | ~338 ms ~342 ms ~352 ms | |
#215 | Qwen3.5-0.8B | 0.8B | INT4 Q8 FP16 | 229 tok/s 180 tok/s 123 tok/s | ~100 ms ~101 ms ~104 ms | |
#216 | Phi-3-mini | 3.8B | INT4 Q8 FP16 | 98 tok/s 63 tok/s 35 tok/s | ~420 ms ~425 ms ~438 ms | |
#217 | Gemma 3n E2B IT | 6B (2B active) | INT4 Q8 FP16 | 75 tok/s 64 tok/s 45 tok/s | ~258 ms ~261 ms ~267 ms | |
#218 | Mistral-7B-Instruct-v0.1 | 7.3B | INT4 Q8 FP16 | 60 tok/s 36 tok/s 19 tok/s | ~777 ms ~787 ms ~811 ms | |
#219 | Llama 3.2 1B | 1B | INT4 Q8 FP16 | 207 tok/s 159 tok/s 105 tok/s | ~125 ms ~127 ms ~130 ms | |
#220 | Gemma 2 2B | 2B | INT4 Q8 FP16 | 146 tok/s 102 tok/s 61 tok/s | ~237 ms ~240 ms ~246 ms | |
#221 | Phi-3-medium | 14B | INT4 Q8 | 34 tok/s 20 tok/s | ~1.5s ~1.5s | |
#222 | OLMo 3 7B Instruct | 7B | INT4 Q8 FP16 | 44 tok/s 31 tok/s 17 tok/s | ~753 ms ~763 ms ~852 ms | |
#224 | Qwen2-7B | 7B | INT4 Q8 FP16 | 62 tok/s 38 tok/s 20 tok/s | ~747 ms ~757 ms ~780 ms | |
#225 | Phi-3-small | 7B | INT4 Q8 FP16 | 62 tok/s 38 tok/s 20 tok/s | ~747 ms ~757 ms ~780 ms | |
#226 | Gemma 3 1B | 1B | INT4 Q8 FP16 | 207 tok/s 159 tok/s 105 tok/s | ~125 ms ~127 ms ~130 ms | |
#227 | Mistral-7B-Instruct-v0.2 | 7.3B | INT4 Q8 FP16 | 60 tok/s 36 tok/s 19 tok/s | ~777 ms ~787 ms ~811 ms | |
#229 | Gemma 1 7B | 7B | INT4 Q8 FP16 | 44 tok/s 31 tok/s 17 tok/s | ~753 ms ~763 ms ~852 ms | |
#230 | Gemma 1 2B | 2B | INT4 Q8 FP16 | 156 tok/s 107 tok/s 63 tok/s | ~236 ms ~239 ms ~246 ms | |
#231 | ChatGLM3-6B | 6B | INT4 Q8 FP16 | 49 tok/s 35 tok/s 21 tok/s | ~651 ms ~659 ms ~679 ms | |
#232 | ChatGLM2-6B | 6B | INT4 Q8 FP16 | 49 tok/s 35 tok/s 21 tok/s | ~651 ms ~659 ms ~679 ms | |
#233 | ChatGLM-6B | 6B | INT4 Q8 FP16 | 49 tok/s 35 tok/s 21 tok/s | ~651 ms ~659 ms ~679 ms | |
未上榜模型(按推理速度排序) | ||||||
- | Qwen2-0.5B | 0.5B | INT4 Q8 FP16 | 269 tok/s 225 tok/s 164 tok/s | ~64 ms ~65 ms ~66 ms | |
- | Qwen2.5-0.5B | 0.5B | INT4 Q8 FP16 | 269 tok/s 225 tok/s 164 tok/s | ~64 ms ~65 ms ~66 ms | |
- | ERNIE-4.5-0.3B | 0.3B | INT4 Q8 FP16 | 263 tok/s 238 tok/s 193 tok/s | ~42 ms ~42 ms ~43 ms | |
- | ERNIE-4.5-0.3B-Base | 0.3B | INT4 Q8 FP16 | 263 tok/s 238 tok/s 193 tok/s | ~42 ms ~42 ms ~43 ms | |
- | Falcon-1B | 1B | INT4 Q8 FP16 | 219 tok/s 165 tok/s 107 tok/s | ~125 ms ~127 ms ~130 ms | |
- | Falcon3-1B | 1B | INT4 Q8 FP16 | 207 tok/s 159 tok/s 105 tok/s | ~125 ms ~127 ms ~130 ms | |
- | Qwen2-1.5B | 1.5B | INT4 Q8 FP16 | 171 tok/s 124 tok/s 77 tok/s | ~181 ms ~183 ms ~188 ms | |
- | Qwen2.5-1.5B | 1.5B | INT4 Q8 FP16 | 171 tok/s 124 tok/s 77 tok/s | ~181 ms ~183 ms ~188 ms | |
- | Spark X2.5 1.7B | 1.7B | INT4 Q8 FP16 | 160 tok/s 114 tok/s 70 tok/s | ~203 ms ~206 ms ~211 ms | |
- | Hy-MT2 1.8B | 1.8B | INT4 Q8 FP16 | 155 tok/s 110 tok/s 67 tok/s | ~214 ms ~216 ms ~222 ms | |
- | Falcon-3B | 3B | INT4 Q8 FP16 | 122 tok/s 79 tok/s 45 tok/s | ~337 ms ~342 ms ~352 ms | |
- | CroissantLLM Base | 1.3B | INT4 Q8 FP16 | 120 tok/s 100 tok/s 70 tok/s | ~161 ms ~163 ms ~167 ms | |
- | Phi-1 | 1.3B | INT4 Q8 FP16 | 120 tok/s 100 tok/s 70 tok/s | ~161 ms ~163 ms ~167 ms | |
- | Phi-1.5 | 1.3B | INT4 Q8 FP16 | 120 tok/s 100 tok/s 70 tok/s | ~161 ms ~163 ms ~167 ms | |
- | DeepSeek-R1 3B | 3B | INT4 Q8 FP16 | 117 tok/s 77 tok/s 44 tok/s | ~338 ms ~342 ms ~352 ms | |
- | Falcon3-3B | 3B | INT4 Q8 FP16 | 115 tok/s 76 tok/s 44 tok/s | ~338 ms ~342 ms ~352 ms | |
- | Qwen2.5-3B | 3B | INT4 Q8 FP16 | 115 tok/s 76 tok/s 44 tok/s | ~338 ms ~342 ms ~352 ms | |
- | ERNIE-4.5-21B-A3B | 21B (3B active) | INT4 | 100 tok/s | ~412 ms | |
- | ERNIE-4.5-21B-A3B-Base | 21B (3B active) | INT4 | 100 tok/s | ~412 ms | |
- | Spark X2.5 4B | 4B | INT4 Q8 FP16 | 95 tok/s 61 tok/s 34 tok/s | ~440 ms ~446 ms ~459 ms | |
- | ERNIE-4.5-VL-28B-A3B | 28B (3B active) | INT4 | 91 tok/s | ~469 ms | |
- | ERNIE-4.5-VL-28B-A3B-Base | 28B (3B active) | INT4 | 91 tok/s | ~469 ms | |
- | Hy-MT2 30B A3B | 30B (3B active) | INT4 | 90 tok/s | ~477 ms | |
- | Phi-2 | 2.7B | INT4 Q8 FP16 | 79 tok/s 62 tok/s 40 tok/s | ~312 ms ~316 ms ~324 ms | |
- | MaLLaM-3B | 3B | INT4 Q8 FP16 | 75 tok/s 58 tok/s 37 tok/s | ~343 ms ~347 ms ~356 ms | |
- | SmolLM3 3B | 3B | INT4 Q8 FP16 | 75 tok/s 58 tok/s 37 tok/s | ~343 ms ~347 ms ~356 ms | |
- | Falcon-7B | 7B | INT4 Q8 FP16 | 65 tok/s 39 tok/s 21 tok/s | ~746 ms ~756 ms ~779 ms | |
- | Falcon3-7B | 7B | INT4 Q8 FP16 | 62 tok/s 38 tok/s 20 tok/s | ~747 ms ~757 ms ~780 ms | |
- | Hy-MT2 7B | 7B | INT4 Q8 FP16 | 62 tok/s 38 tok/s 20 tok/s | ~747 ms ~757 ms ~780 ms | |
- | Mistral-7B-v0.1 | 7.3B | INT4 Q8 FP16 | 60 tok/s 36 tok/s 19 tok/s | ~777 ms ~787 ms ~811 ms | |
- | LensVLM 9B | 9B | INT4 Q8 FP16 | 50 tok/s 30 tok/s 14 tok/s | ~952 ms ~966 ms ~1.2s | |
- | MiMo V2.6 Distill Qwen 9B | 9B | INT4 Q8 FP16 | 50 tok/s 30 tok/s 14 tok/s | ~952 ms ~966 ms ~1.2s | |
- | ChatGLM3-6B-32K | 6B | INT4 Q8 FP16 | 49 tok/s 35 tok/s 21 tok/s | ~651 ms ~659 ms ~679 ms | |
- | Yi-6B | 6B | INT4 Q8 FP16 | 49 tok/s 35 tok/s 21 tok/s | ~651 ms ~659 ms ~679 ms | |
- | Falcon3-10B | 10B | INT4 Q8 | 46 tok/s 27 tok/s | ~1.1s ~1.1s | |
- | Kimi-VL-A3B-Instruct | 16B (3B active) | INT4 Q8 | 46 tok/s 36 tok/s | ~407 ms ~480 ms | |
- | Falcon2-11B | 11B | INT4 Q8 | 44 tok/s 26 tok/s | ~1.2s ~1.2s | |
- | Hunyuan Lite | 7B | INT4 Q8 FP16 | 44 tok/s 31 tok/s 17 tok/s | ~753 ms ~763 ms ~852 ms | |
- | OLMo 3 7B Base | 7B | INT4 Q8 FP16 | 44 tok/s 31 tok/s 17 tok/s | ~753 ms ~763 ms ~852 ms | |
- | SEA-LION-7B | 7.1B | INT4 Q8 FP16 | 44 tok/s 30 tok/s 17 tok/s | ~763 ms ~773 ms ~863 ms | |
- | SEA-LION-7B-Instruct | 7.1B | INT4 Q8 FP16 | 44 tok/s 30 tok/s 17 tok/s | ~763 ms ~773 ms ~863 ms | |
- | Sahabat-AI-Llama3-8B-Instruct | 8B | INT4 Q8 FP16 | 40 tok/s 27 tok/s 14 tok/s | ~856 ms ~867 ms ~1.0s | |
- | Typhoon-2-8B | 8B | INT4 Q8 FP16 | 40 tok/s 27 tok/s 14 tok/s | ~856 ms ~867 ms ~1.0s | |
- | GLM-4-9B | 9B | INT4 Q8 | 36 tok/s 25 tok/s | ~960 ms ~973 ms | |
- | GLM-4-9B-Chat | 9B | INT4 Q8 | 36 tok/s 25 tok/s | ~960 ms ~973 ms | |
- | GLM-4-9B-Chat-1M | 9B | INT4 Q8 | 36 tok/s 25 tok/s | ~960 ms ~973 ms | |
- | Sahabat-AI-Gemma2-9B | 9.2B | INT4 Q8 | 36 tok/s 24 tok/s | ~980 ms ~993 ms | |
- | Sahabat-AI-Gemma2-9B-Instruct | 9.2B | INT4 Q8 | 36 tok/s 24 tok/s | ~980 ms ~993 ms | |
- | Yi-9B | 9B | INT4 Q8 | 36 tok/s 25 tok/s | ~960 ms ~973 ms | |
- | GreenMind-14B-R1 | 14B | INT4 Q8 | 25 tok/s 16 tok/s | ~1.5s ~1.6s | |
不同量化精度下可运行的最大模型参数级别。
上下文长度:
4位量化
14B 模型
8位精度
14B 模型
16位全精度
8B 模型
本地模型训练与适配器微调支持能力。
微调上下文:
QLoRA
32B 模型
LoRA
8B 模型
全参数微调
1B 模型
NVIDIA RTX 4000 Ada Generation (20GB) 上的最佳量化精度与运行规格建议。
最佳推理区间
适合在全精度或 Q8 精度下运行 14B 模型,以及在 Q4 精度下搭配最高 32k 上下文运行 32B 模型。
显存带宽与推理速率
具备 360 GB/s 聚合带宽,单批次推理处于显存带宽受限模式。8B Q4 模型预估生成速度约 80 tok/s,70B Q4 模型预估生成速度约 9 tok/s。
Assistant
在线