趋近智
NVIDIA RTX 4500 Ada Generation (24GB) 配备 24 GB 专用显存与 432 GB/s 显存带宽,支持 CUDA 和 TensorRT-LLM 运行环境,可进行全精度与量化大模型推理。
总显存
24 GB
可用显存上限
24 GB
显存带宽
432 GB/s
最大推理模型级别
32B 模型 (Q4)
热设计功耗
210W
随上下文长度增长的显存需求评估。当曲线超过参考线时将导致显存不足(OOM)。
量化精度:
主流开源大模型在 NVIDIA RTX 4500 Ada Generation (24GB) 上的推理速度、显存兼容性与生成吞吐表现。
排序:
上下文长度:
KV 缓存:
显卡数量:
| 排名 | 模型 | 参数量 | 量化精度 | 预估 TPS | TTFT | 可运行 |
|---|---|---|---|---|---|---|
#33 | Qwen 3.8 27B | 27B | INT4 | 22 tok/s | ~1.9s | |
#48 | Agnes 3.0 Flash | 33B | INT4 | 19 tok/s | ~2.3s | |
#72 | K2 Horizon MoVA 36B A4B | 36B (4B active) | INT4 | 87 tok/s | ~407 ms | |
#83 | Qwen3.5-27B | 27B | INT4 | 22 tok/s | ~1.9s | |
#92 | Sarvam-30B | 32B (2.4B active) | INT4 | 119 tok/s | ~264 ms | |
#94 | Qwen3.6 35B A3B | 35B (3B active) | INT4 | 102 tok/s | ~332 ms | |
#96 | Muse Glimmer 30B | 30B | INT4 | 20 tok/s | ~2.1s | |
#100 | Phi-4 Reasoning Plus | 14B | INT4 Q8 | 30 tok/s 20 tok/s | ~1.0s ~1.0s | |
#101 | MiMo V2 Flash | 15B (309B active) | INT4 Q8 | 2 tok/s 1 tok/s | ~20.7s ~22.8s | |
#108 | Gemma 4 26B A4B | 25.2B (3.8B active) | INT4 | 98 tok/s | ~344 ms | |
#109 | Gemma 4 12B | 11.95B | INT4 Q8 | 34 tok/s 23 tok/s | ~864 ms ~878 ms | |
#113 | Qwen3.5-9B | 9B | INT4 Q8 FP16 | 59 tok/s 36 tok/s 18 tok/s | ~649 ms ~661 ms ~742 ms | |
#114 | Qwen3.5-35B-A3B | 35B (3B active) | INT4 | 102 tok/s | ~332 ms | |
#118 | K2 Horizon 7B | 7B | INT4 Q8 FP16 | 72 tok/s 44 tok/s 24 tok/s | ~510 ms ~518 ms ~537 ms | |
#128 | NVIDIA Nemotron 3 Nano 30B-A3B | 3.5B (30B active) | INT4 Q8 FP16 | 19 tok/s 11 tok/s 6 tok/s | ~2.0s ~2.1s ~2.2s | |
#129 | Gemma 4 31B | 30.7B | INT4 | 20 tok/s | ~2.1s | |
#131 | Nemotron 3.5 Lightning | 30B (3B active) | INT4 | 40 tok/s | ~341 ms | |
#132 | Qwen3.5-4B | 4B | INT4 Q8 FP16 | 108 tok/s 71 tok/s 40 tok/s | ~301 ms ~306 ms ~317 ms | |
#133 | Qwen3-30B-A3B | 30B (3B active) | INT4 | 108 tok/s | ~301 ms | |
#136 | GPT-OSS 20B | 21B (3.6B active) | INT4 | 47 tok/s | ~334 ms | |
#146 | Granite 4.2 8B | 8B | INT4 Q8 FP16 | 65 tok/s 40 tok/s 21 tok/s | ~579 ms ~589 ms ~611 ms | |
#150 | Gemma 4 E4B | 8B | INT4 Q8 FP16 | 65 tok/s 40 tok/s 21 tok/s | ~579 ms ~589 ms ~611 ms | |
#151 | Nemotron 3.5 Lightning 30B A3B | 30B (3B active) | INT4 | 108 tok/s | ~301 ms | |
#153 | Qwen3-32B | 32B | INT4 | 19 tok/s | ~2.2s | |
#156 | GLM-4 | 32B | INT4 | 13 tok/s | ~2.6s | |
#158 | GLM-4V | 9B | INT4 Q8 FP16 | 42 tok/s 29 tok/s 16 tok/s | ~656 ms ~667 ms ~748 ms | |
#159 | Gemma 3 27B | 27B | INT4 | 22 tok/s | ~1.9s | |
#160 | Phi-4 | 14B | INT4 Q8 | 40 tok/s 24 tok/s | ~999 ms ~1.0s | |
#162 | DeepSeek-R1 32B | 32B | INT4 | 20 tok/s | ~2.2s | |
#164 | Qwen2.5-32B | 32B | INT4 | 19 tok/s | ~2.2s | |
#168 | Magistral Small | 24B | INT4 | 19 tok/s | ~1.7s | |
#169 | OLMo 3 7B Think | 7B | INT4 Q8 FP16 | 52 tok/s 36 tok/s 21 tok/s | ~515 ms ~523 ms ~542 ms | |
#170 | OLMo 3.1 32B Instruct | 32B | INT4 | 13 tok/s | ~2.6s | |
#172 | DeepSeek-R1 14B | 14B | INT4 Q8 | 42 tok/s 24 tok/s | ~998 ms ~1.0s | |
#173 | Ministral 3 14B | 14B | INT4 Q8 | 30 tok/s 20 tok/s | ~1.0s ~1.0s | |
#177 | Gemma 3 12B | 12B | INT4 Q8 FP16 | 46 tok/s 27 tok/s 13 tok/s | ~859 ms ~874 ms ~1.1s | |
#180 | OLMo 3 32B Base | 32B | INT4 | 13 tok/s | ~2.6s | |
#181 | Mistral-Small-2501 | 24B | INT4 | 25 tok/s | ~1.7s | |
#182 | Ministral 3 8B | 8B | INT4 Q8 FP16 | 47 tok/s 32 tok/s 18 tok/s | ~585 ms ~594 ms ~667 ms | |
#183 | Qwen3.5-2B | 2B | INT4 Q8 FP16 | 162 tok/s 116 tok/s 71 tok/s | ~163 ms ~166 ms ~171 ms | |
#184 | MiniCPM5-2B | 2B | INT4 Q8 FP16 | 162 tok/s 116 tok/s 71 tok/s | ~163 ms ~166 ms ~171 ms | |
#185 | Qwen2.5-14B | 14B | INT4 Q8 | 40 tok/s 24 tok/s | ~999 ms ~1.0s | |
#186 | Gemma 2 27B | 27B | INT4 | 22 tok/s | ~1.9s | |
#187 | OLMo 3.1 32B Think | 32B | INT4 | 13 tok/s | ~2.6s | |
#188 | Gemma 4 E2B | 5.1B | INT4 Q8 FP16 | 92 tok/s 58 tok/s 32 tok/s | ~378 ms ~384 ms ~398 ms | |
#189 | Qwen3-4B | 4B | INT4 Q8 FP16 | 108 tok/s 71 tok/s 40 tok/s | ~301 ms ~306 ms ~317 ms | |
#190 | DeepSeek-R1 8B | 8B | INT4 Q8 FP16 | 67 tok/s 40 tok/s 21 tok/s | ~578 ms ~588 ms ~610 ms | |
#193 | Ministral 3 3B | 3B | INT4 Q8 FP16 | 87 tok/s 67 tok/s 43 tok/s | ~236 ms ~239 ms ~247 ms | |
#195 | Qwen3-14B | 14B | INT4 Q8 | 40 tok/s 24 tok/s | ~999 ms ~1.0s | |
#197 | Gemma 2 9B | 9B | INT4 Q8 FP16 | 59 tok/s 36 tok/s 18 tok/s | ~649 ms ~661 ms ~742 ms | |
#198 | Qwen2.5-7B | 7B | INT4 Q8 FP16 | 72 tok/s 44 tok/s 24 tok/s | ~510 ms ~518 ms ~537 ms | |
#199 | Qwen3-8B | 8B | INT4 Q8 FP16 | 65 tok/s 40 tok/s 21 tok/s | ~579 ms ~589 ms ~611 ms | |
#200 | Gemma 3 4B | 4B | INT4 Q8 FP16 | 108 tok/s 71 tok/s 40 tok/s | ~301 ms ~306 ms ~317 ms | |
#201 | DeepSeek-R1 7B | 7B | INT4 Q8 FP16 | 74 tok/s 45 tok/s 24 tok/s | ~509 ms ~518 ms ~537 ms | |
#202 | Llama 3.1 8B | 8B | INT4 Q8 FP16 | 65 tok/s 40 tok/s 21 tok/s | ~579 ms ~589 ms ~611 ms | |
#204 | Qwen3-1.7B | 1.7B | INT4 Q8 FP16 | 177 tok/s 129 tok/s 81 tok/s | ~141 ms ~143 ms ~147 ms | |
#205 | Command R | 35B | INT4 | 12 tok/s | ~2.9s | |
#206 | Gemma 3 270M | 0.27B | INT4 Q8 FP16 | 285 tok/s 263 tok/s 220 tok/s | ~28 ms ~29 ms ~29 ms | |
#208 | Llama 3 8B | 8B | INT4 Q8 FP16 | 65 tok/s 40 tok/s 21 tok/s | ~579 ms ~589 ms ~611 ms | |
#209 | Qwen3-0.6B | 0.6B | INT4 Q8 FP16 | 268 tok/s 224 tok/s 164 tok/s | ~54 ms ~55 ms ~56 ms | |
#210 | Phi-4-Mini | 3.8B | INT4 Q8 FP16 | 112 tok/s 74 tok/s 42 tok/s | ~287 ms ~292 ms ~302 ms | |
#212 | Ministral-8B-2410 | 8B | INT4 Q8 FP16 | 65 tok/s 40 tok/s 21 tok/s | ~579 ms ~589 ms ~611 ms | |
#213 | DeepSeek-R1 1.5B | 1.5B | INT4 Q8 FP16 | 188 tok/s 140 tok/s 89 tok/s | ~125 ms ~127 ms ~131 ms | |
#214 | Llama 3.2 3B | 3B | INT4 Q8 FP16 | 130 tok/s 88 tok/s 51 tok/s | ~232 ms ~236 ms ~244 ms | |
#215 | Qwen3.5-0.8B | 0.8B | INT4 Q8 FP16 | 244 tok/s 197 tok/s 138 tok/s | ~70 ms ~71 ms ~74 ms | |
#216 | Phi-3-mini | 3.8B | INT4 Q8 FP16 | 112 tok/s 74 tok/s 42 tok/s | ~287 ms ~292 ms ~302 ms | |
#217 | Gemma 3n E2B IT | 6B (2B active) | INT4 Q8 FP16 | 87 tok/s 74 tok/s 53 tok/s | ~179 ms ~181 ms ~186 ms | |
#218 | Mistral-7B-Instruct-v0.1 | 7.3B | INT4 Q8 FP16 | 70 tok/s 43 tok/s 23 tok/s | ~530 ms ~539 ms ~559 ms | |
#219 | Llama 3.2 1B | 1B | INT4 Q8 FP16 | 223 tok/s 176 tok/s 119 tok/s | ~88 ms ~89 ms ~92 ms | |
#220 | Gemma 2 2B | 2B | INT4 Q8 FP16 | 162 tok/s 116 tok/s 71 tok/s | ~163 ms ~166 ms ~171 ms | |
#221 | Phi-3-medium | 14B | INT4 Q8 | 40 tok/s 24 tok/s | ~999 ms ~1.0s | |
#222 | OLMo 3 7B Instruct | 7B | INT4 Q8 FP16 | 52 tok/s 36 tok/s 21 tok/s | ~515 ms ~523 ms ~542 ms | |
#223 | Yi-34B | 34B | INT4 | 13 tok/s | ~2.8s | |
#224 | Qwen2-7B | 7B | INT4 Q8 FP16 | 72 tok/s 44 tok/s 24 tok/s | ~510 ms ~518 ms ~537 ms | |
#225 | Phi-3-small | 7B | INT4 Q8 FP16 | 72 tok/s 44 tok/s 24 tok/s | ~510 ms ~518 ms ~537 ms | |
#226 | Gemma 3 1B | 1B | INT4 Q8 FP16 | 223 tok/s 176 tok/s 119 tok/s | ~88 ms ~89 ms ~92 ms | |
#227 | Mistral-7B-Instruct-v0.2 | 7.3B | INT4 Q8 FP16 | 70 tok/s 43 tok/s 23 tok/s | ~530 ms ~539 ms ~559 ms | |
#229 | Gemma 1 7B | 7B | INT4 Q8 FP16 | 52 tok/s 36 tok/s 21 tok/s | ~515 ms ~523 ms ~542 ms | |
#230 | Gemma 1 2B | 2B | INT4 Q8 FP16 | 173 tok/s 121 tok/s 73 tok/s | ~163 ms ~165 ms ~171 ms | |
#231 | ChatGLM3-6B | 6B | INT4 Q8 FP16 | 57 tok/s 41 tok/s 25 tok/s | ~445 ms ~452 ms ~469 ms | |
#232 | ChatGLM2-6B | 6B | INT4 Q8 FP16 | 57 tok/s 41 tok/s 25 tok/s | ~445 ms ~452 ms ~469 ms | |
#233 | ChatGLM-6B | 6B | INT4 Q8 FP16 | 57 tok/s 41 tok/s 25 tok/s | ~445 ms ~452 ms ~469 ms | |
未上榜模型(按推理速度排序) | ||||||
- | Qwen2-0.5B | 0.5B | INT4 Q8 FP16 | 282 tok/s 240 tok/s 181 tok/s | ~46 ms ~47 ms ~48 ms | |
- | Qwen2.5-0.5B | 0.5B | INT4 Q8 FP16 | 282 tok/s 240 tok/s 181 tok/s | ~46 ms ~47 ms ~48 ms | |
- | ERNIE-4.5-0.3B | 0.3B | INT4 Q8 FP16 | 277 tok/s 253 tok/s 210 tok/s | ~31 ms ~31 ms ~32 ms | |
- | ERNIE-4.5-0.3B-Base | 0.3B | INT4 Q8 FP16 | 277 tok/s 253 tok/s 210 tok/s | ~31 ms ~31 ms ~32 ms | |
- | Falcon-1B | 1B | INT4 Q8 FP16 | 235 tok/s 182 tok/s 122 tok/s | ~87 ms ~89 ms ~91 ms | |
- | Falcon3-1B | 1B | INT4 Q8 FP16 | 223 tok/s 176 tok/s 119 tok/s | ~88 ms ~89 ms ~92 ms | |
- | Qwen2-1.5B | 1.5B | INT4 Q8 FP16 | 188 tok/s 140 tok/s 89 tok/s | ~125 ms ~127 ms ~131 ms | |
- | Qwen2.5-1.5B | 1.5B | INT4 Q8 FP16 | 188 tok/s 140 tok/s 89 tok/s | ~125 ms ~127 ms ~131 ms | |
- | Spark X2.5 1.7B | 1.7B | INT4 Q8 FP16 | 177 tok/s 129 tok/s 81 tok/s | ~141 ms ~143 ms ~147 ms | |
- | Hy-MT2 1.8B | 1.8B | INT4 Q8 FP16 | 172 tok/s 125 tok/s 77 tok/s | ~148 ms ~150 ms ~155 ms | |
- | Falcon-3B | 3B | INT4 Q8 FP16 | 138 tok/s 91 tok/s 52 tok/s | ~232 ms ~235 ms ~244 ms | |
- | CroissantLLM Base | 1.3B | INT4 Q8 FP16 | 135 tok/s 114 tok/s 81 tok/s | ~112 ms ~114 ms ~117 ms | |
- | Phi-1 | 1.3B | INT4 Q8 FP16 | 135 tok/s 114 tok/s 81 tok/s | ~112 ms ~114 ms ~117 ms | |
- | Phi-1.5 | 1.3B | INT4 Q8 FP16 | 135 tok/s 114 tok/s 81 tok/s | ~112 ms ~114 ms ~117 ms | |
- | DeepSeek-R1 3B | 3B | INT4 Q8 FP16 | 132 tok/s 89 tok/s 51 tok/s | ~232 ms ~236 ms ~244 ms | |
- | Falcon3-3B | 3B | INT4 Q8 FP16 | 130 tok/s 88 tok/s 51 tok/s | ~232 ms ~236 ms ~244 ms | |
- | Qwen2.5-3B | 3B | INT4 Q8 FP16 | 130 tok/s 88 tok/s 51 tok/s | ~232 ms ~236 ms ~244 ms | |
- | ERNIE-4.5-21B-A3B | 21B (3B active) | INT4 Q8 | 114 tok/s 73 tok/s | ~282 ms ~334 ms | |
- | ERNIE-4.5-21B-A3B-Base | 21B (3B active) | INT4 Q8 | 114 tok/s 73 tok/s | ~282 ms ~334 ms | |
- | ERNIE-4.5-VL-28B-A3B | 28B (3B active) | INT4 | 110 tok/s | ~296 ms | |
- | ERNIE-4.5-VL-28B-A3B-Base | 28B (3B active) | INT4 | 110 tok/s | ~296 ms | |
- | Hy-MT2 30B A3B | 30B (3B active) | INT4 | 108 tok/s | ~301 ms | |
- | Spark X2.5 4B | 4B | INT4 Q8 FP16 | 108 tok/s 71 tok/s 40 tok/s | ~301 ms ~306 ms ~317 ms | |
- | Phi-2 | 2.7B | INT4 Q8 FP16 | 91 tok/s 72 tok/s 47 tok/s | ~215 ms ~218 ms ~225 ms | |
- | MaLLaM-3B | 3B | INT4 Q8 FP16 | 87 tok/s 67 tok/s 43 tok/s | ~236 ms ~239 ms ~247 ms | |
- | SmolLM3 3B | 3B | INT4 Q8 FP16 | 87 tok/s 67 tok/s 43 tok/s | ~236 ms ~239 ms ~247 ms | |
- | Falcon-7B | 7B | INT4 Q8 FP16 | 75 tok/s 46 tok/s 24 tok/s | ~509 ms ~518 ms ~537 ms | |
- | Falcon3-7B | 7B | INT4 Q8 FP16 | 72 tok/s 44 tok/s 24 tok/s | ~510 ms ~518 ms ~537 ms | |
- | Hy-MT2 7B | 7B | INT4 Q8 FP16 | 72 tok/s 44 tok/s 24 tok/s | ~510 ms ~518 ms ~537 ms | |
- | Mistral-7B-v0.1 | 7.3B | INT4 Q8 FP16 | 70 tok/s 43 tok/s 23 tok/s | ~530 ms ~539 ms ~559 ms | |
- | LensVLM 9B | 9B | INT4 Q8 FP16 | 59 tok/s 36 tok/s 18 tok/s | ~649 ms ~661 ms ~742 ms | |
- | MiMo V2.6 Distill Qwen 9B | 9B | INT4 Q8 FP16 | 59 tok/s 36 tok/s 18 tok/s | ~649 ms ~661 ms ~742 ms | |
- | ChatGLM3-6B-32K | 6B | INT4 Q8 FP16 | 57 tok/s 41 tok/s 25 tok/s | ~445 ms ~452 ms ~469 ms | |
- | Yi-6B | 6B | INT4 Q8 FP16 | 57 tok/s 41 tok/s 25 tok/s | ~445 ms ~452 ms ~469 ms | |
- | Falcon3-10B | 10B | INT4 Q8 FP16 | 54 tok/s 32 tok/s 16 tok/s | ~719 ms ~731 ms ~822 ms | |
- | Kimi-VL-A3B-Instruct | 16B (3B active) | INT4 Q8 | 54 tok/s 45 tok/s | ~281 ms ~307 ms | |
- | Falcon2-11B | 11B | INT4 Q8 FP16 | 52 tok/s 30 tok/s 14 tok/s | ~788 ms ~801 ms ~972 ms | |
- | Hunyuan Lite | 7B | INT4 Q8 FP16 | 52 tok/s 36 tok/s 21 tok/s | ~515 ms ~523 ms ~542 ms | |
- | OLMo 3 7B Base | 7B | INT4 Q8 FP16 | 52 tok/s 36 tok/s 21 tok/s | ~515 ms ~523 ms ~542 ms | |
- | SEA-LION-7B | 7.1B | INT4 Q8 FP16 | 51 tok/s 36 tok/s 21 tok/s | ~522 ms ~530 ms ~550 ms | |
- | SEA-LION-7B-Instruct | 7.1B | INT4 Q8 FP16 | 51 tok/s 36 tok/s 21 tok/s | ~522 ms ~530 ms ~550 ms | |
- | Sahabat-AI-Llama3-8B-Instruct | 8B | INT4 Q8 FP16 | 47 tok/s 32 tok/s 18 tok/s | ~585 ms ~594 ms ~667 ms | |
- | Typhoon-2-8B | 8B | INT4 Q8 FP16 | 47 tok/s 32 tok/s 18 tok/s | ~585 ms ~594 ms ~667 ms | |
- | GLM-4-9B | 9B | INT4 Q8 FP16 | 42 tok/s 29 tok/s 16 tok/s | ~656 ms ~667 ms ~748 ms | |
- | GLM-4-9B-Chat | 9B | INT4 Q8 FP16 | 42 tok/s 29 tok/s 16 tok/s | ~656 ms ~667 ms ~748 ms | |
- | GLM-4-9B-Chat-1M | 9B | INT4 Q8 FP16 | 42 tok/s 29 tok/s 16 tok/s | ~656 ms ~667 ms ~748 ms | |
- | Sahabat-AI-Gemma2-9B | 9.2B | INT4 Q8 FP16 | 42 tok/s 29 tok/s 16 tok/s | ~670 ms ~680 ms ~764 ms | |
- | Sahabat-AI-Gemma2-9B-Instruct | 9.2B | INT4 Q8 FP16 | 42 tok/s 29 tok/s 16 tok/s | ~670 ms ~680 ms ~764 ms | |
- | Yi-9B | 9B | INT4 Q8 FP16 | 42 tok/s 29 tok/s 16 tok/s | ~656 ms ~667 ms ~748 ms | |
- | GreenMind-14B-R1 | 14B | INT4 Q8 | 30 tok/s 20 tok/s | ~1.0s ~1.0s | |
- | Falcon-40B | 40B | INT4 | 15 tok/s | ~3.0s | |
不同量化精度下可运行的最大模型参数级别。
上下文长度:
4位量化
32B 模型
8位精度
14B 模型
16位全精度
8B 模型
本地模型训练与适配器微调支持能力。
微调上下文:
QLoRA
32B 模型
LoRA
14B 模型
全参数微调
3B 模型
NVIDIA RTX 4500 Ada Generation (24GB) 上的最佳量化精度与运行规格建议。
最佳推理区间
适合在全精度或 Q8 精度下运行 14B 模型,以及在 Q4 精度下搭配最高 32k 上下文运行 32B 模型。
显存带宽与推理速率
具备 432 GB/s 聚合带宽,单批次推理处于显存带宽受限模式。8B Q4 模型预估生成速度约 96 tok/s,70B Q4 模型预估生成速度约 11 tok/s。
Assistant
在线