趋近智
NVIDIA RTX 3090 Ti (24GB) 配备 24 GB 专用显存与 1008 GB/s 显存带宽,支持 CUDA 和 TensorRT-LLM 运行环境,可进行全精度与量化大模型推理。
总显存
24 GB
可用显存上限
24 GB
显存带宽
1008 GB/s
最大推理模型级别
32B 模型 (Q4)
热设计功耗
450W
随上下文长度增长的显存需求评估。当曲线超过参考线时将导致显存不足(OOM)。
量化精度:
主流开源大模型在 NVIDIA RTX 3090 Ti (24GB) 上的推理速度、显存兼容性与生成吞吐表现。
排序:
上下文长度:
KV 缓存:
显卡数量:
| 排名 | 模型 | 参数量 | 量化精度 | 预估 TPS | TTFT | 可运行 |
|---|---|---|---|---|---|---|
#33 | Qwen 3.8 27B | 27B | INT4 | 48 tok/s | ~1.9s | |
#48 | Agnes 3.0 Flash | 33B | INT4 | 41 tok/s | ~2.3s | |
#72 | K2 Horizon MoVA 36B A4B | 36B (4B active) | INT4 | 153 tok/s | ~398 ms | |
#83 | Qwen3.5-27B | 27B | INT4 | 48 tok/s | ~1.9s | |
#92 | Sarvam-30B | 32B (2.4B active) | INT4 | 194 tok/s | ~258 ms | |
#94 | Qwen3.6 35B A3B | 35B (3B active) | INT4 | 171 tok/s | ~325 ms | |
#96 | Muse Glimmer 30B | 30B | INT4 | 44 tok/s | ~2.1s | |
#100 | Phi-4 Reasoning Plus | 14B | INT4 Q8 | 62 tok/s 43 tok/s | ~981 ms ~988 ms | |
#101 | MiMo V2 Flash | 15B (309B active) | INT4 Q8 | 5 tok/s 3 tok/s | ~20.2s ~22.1s | |
#108 | Gemma 4 26B A4B | 25.2B (3.8B active) | INT4 | 169 tok/s | ~337 ms | |
#109 | Gemma 4 12B | 11.95B | INT4 Q8 | 70 tok/s 49 tok/s | ~841 ms ~847 ms | |
#113 | Qwen3.5-9B | 9B | INT4 Q8 FP16 | 113 tok/s 74 tok/s 39 tok/s | ~635 ms ~640 ms ~705 ms | |
#114 | Qwen3.5-35B-A3B | 35B (3B active) | INT4 | 171 tok/s | ~325 ms | |
#118 | K2 Horizon 7B | 7B | INT4 Q8 FP16 | 134 tok/s 89 tok/s 52 tok/s | ~498 ms ~502 ms ~510 ms | |
#128 | NVIDIA Nemotron 3 Nano 30B-A3B | 3.5B (30B active) | INT4 Q8 FP16 | 42 tok/s 25 tok/s 13 tok/s | ~2.0s ~2.0s ~2.0s | |
#129 | Gemma 4 31B | 30.7B | INT4 | 43 tok/s | ~2.1s | |
#131 | Nemotron 3.5 Lightning | 30B (3B active) | INT4 | 81 tok/s | ~326 ms | |
#132 | Qwen3.5-4B | 4B | INT4 Q8 FP16 | 182 tok/s 131 tok/s 81 tok/s | ~295 ms ~297 ms ~302 ms | |
#133 | Qwen3-30B-A3B | 30B (3B active) | INT4 | 182 tok/s | ~294 ms | |
#136 | GPT-OSS 20B | 21B (3.6B active) | INT4 | 93 tok/s | ~320 ms | |
#146 | Granite 4.2 8B | 8B | INT4 Q8 FP16 | 123 tok/s 81 tok/s 46 tok/s | ~566 ms ~570 ms ~580 ms | |
#150 | Gemma 4 E4B | 8B | INT4 Q8 FP16 | 123 tok/s 81 tok/s 46 tok/s | ~566 ms ~570 ms ~580 ms | |
#151 | Nemotron 3.5 Lightning 30B A3B | 30B (3B active) | INT4 | 182 tok/s | ~294 ms | |
#153 | Qwen3-32B | 32B | INT4 | 42 tok/s | ~2.2s | |
#156 | GLM-4 | 32B | INT4 | 30 tok/s | ~2.6s | |
#158 | GLM-4V | 9B | INT4 Q8 FP16 | 86 tok/s 62 tok/s 36 tok/s | ~638 ms ~642 ms ~708 ms | |
#159 | Gemma 3 27B | 27B | INT4 | 48 tok/s | ~1.9s | |
#160 | Phi-4 | 14B | INT4 Q8 | 82 tok/s 51 tok/s | ~977 ms ~984 ms | |
#162 | DeepSeek-R1 32B | 32B | INT4 | 43 tok/s | ~2.2s | |
#164 | Qwen2.5-32B | 32B | INT4 | 42 tok/s | ~2.2s | |
#168 | Magistral Small | 24B | INT4 | 41 tok/s | ~1.7s | |
#169 | OLMo 3 7B Think | 7B | INT4 Q8 FP16 | 101 tok/s 75 tok/s 46 tok/s | ~501 ms ~504 ms ~512 ms | |
#170 | OLMo 3.1 32B Instruct | 32B | INT4 | 30 tok/s | ~2.6s | |
#172 | DeepSeek-R1 14B | 14B | INT4 Q8 | 85 tok/s 52 tok/s | ~976 ms ~984 ms | |
#173 | Ministral 3 14B | 14B | INT4 Q8 | 62 tok/s 43 tok/s | ~981 ms ~988 ms | |
#177 | Gemma 3 12B | 12B | INT4 Q8 FP16 | 92 tok/s 58 tok/s 29 tok/s | ~840 ms ~847 ms ~1.0s | |
#180 | OLMo 3 32B Base | 32B | INT4 | 30 tok/s | ~2.6s | |
#181 | Mistral-Small-2501 | 24B | INT4 | 53 tok/s | ~1.7s | |
#182 | Ministral 3 8B | 8B | INT4 Q8 FP16 | 93 tok/s 68 tok/s 39 tok/s | ~569 ms ~573 ms ~631 ms | |
#183 | Qwen3.5-2B | 2B | INT4 Q8 FP16 | 239 tok/s 191 tok/s 132 tok/s | ~160 ms ~161 ms ~163 ms | |
#184 | MiniCPM5-2B | 2B | INT4 Q8 FP16 | 239 tok/s 191 tok/s 132 tok/s | ~160 ms ~161 ms ~163 ms | |
#185 | Qwen2.5-14B | 14B | INT4 Q8 | 82 tok/s 51 tok/s | ~977 ms ~984 ms | |
#186 | Gemma 2 27B | 27B | INT4 | 48 tok/s | ~1.9s | |
#187 | OLMo 3.1 32B Think | 32B | INT4 | 30 tok/s | ~2.6s | |
#188 | Gemma 4 E2B | 5.1B | INT4 Q8 FP16 | 161 tok/s 112 tok/s 67 tok/s | ~369 ms ~372 ms ~378 ms | |
#189 | Qwen3-4B | 4B | INT4 Q8 FP16 | 182 tok/s 131 tok/s 81 tok/s | ~295 ms ~297 ms ~302 ms | |
#190 | DeepSeek-R1 8B | 8B | INT4 Q8 FP16 | 125 tok/s 82 tok/s 46 tok/s | ~566 ms ~570 ms ~580 ms | |
#193 | Ministral 3 3B | 3B | INT4 Q8 FP16 | 154 tok/s 126 tok/s 88 tok/s | ~229 ms ~230 ms ~234 ms | |
#195 | Qwen3-14B | 14B | INT4 Q8 | 82 tok/s 51 tok/s | ~977 ms ~984 ms | |
#197 | Gemma 2 9B | 9B | INT4 Q8 FP16 | 113 tok/s 74 tok/s 39 tok/s | ~635 ms ~640 ms ~705 ms | |
#198 | Qwen2.5-7B | 7B | INT4 Q8 FP16 | 134 tok/s 89 tok/s 52 tok/s | ~498 ms ~502 ms ~510 ms | |
#199 | Qwen3-8B | 8B | INT4 Q8 FP16 | 123 tok/s 81 tok/s 46 tok/s | ~566 ms ~570 ms ~580 ms | |
#200 | Gemma 3 4B | 4B | INT4 Q8 FP16 | 182 tok/s 131 tok/s 81 tok/s | ~295 ms ~297 ms ~302 ms | |
#201 | DeepSeek-R1 7B | 7B | INT4 Q8 FP16 | 136 tok/s 91 tok/s 52 tok/s | ~498 ms ~502 ms ~510 ms | |
#202 | Llama 3.1 8B | 8B | INT4 Q8 FP16 | 123 tok/s 81 tok/s 46 tok/s | ~566 ms ~570 ms ~580 ms | |
#204 | Qwen3-1.7B | 1.7B | INT4 Q8 FP16 | 252 tok/s 206 tok/s 146 tok/s | ~138 ms ~138 ms ~140 ms | |
#205 | Command R | 35B | INT4 | 28 tok/s | ~2.8s | |
#206 | Gemma 3 270M | 0.27B | INT4 Q8 FP16 | 328 tok/s 315 tok/s 287 tok/s | ~28 ms ~28 ms ~28 ms | |
#208 | Llama 3 8B | 8B | INT4 Q8 FP16 | 123 tok/s 81 tok/s 46 tok/s | ~566 ms ~570 ms ~580 ms | |
#209 | Qwen3-0.6B | 0.6B | INT4 Q8 FP16 | 318 tok/s 289 tok/s 241 tok/s | ~53 ms ~53 ms ~54 ms | |
#210 | Phi-4-Mini | 3.8B | INT4 Q8 FP16 | 186 tok/s 136 tok/s 85 tok/s | ~281 ms ~283 ms ~288 ms | |
#212 | Ministral-8B-2410 | 8B | INT4 Q8 FP16 | 123 tok/s 81 tok/s 46 tok/s | ~566 ms ~570 ms ~580 ms | |
#213 | DeepSeek-R1 1.5B | 1.5B | INT4 Q8 FP16 | 262 tok/s 217 tok/s 157 tok/s | ~122 ms ~123 ms ~125 ms | |
#214 | Llama 3.2 3B | 3B | INT4 Q8 FP16 | 207 tok/s 156 tok/s 101 tok/s | ~227 ms ~229 ms ~232 ms | |
#215 | Qwen3.5-0.8B | 0.8B | INT4 Q8 FP16 | 303 tok/s 269 tok/s 215 tok/s | ~69 ms ~69 ms ~70 ms | |
#216 | Phi-3-mini | 3.8B | INT4 Q8 FP16 | 186 tok/s 136 tok/s 85 tok/s | ~281 ms ~283 ms ~288 ms | |
#217 | Gemma 3n E2B IT | 6B (2B active) | INT4 Q8 FP16 | 154 tok/s 136 tok/s 103 tok/s | ~172 ms ~173 ms ~175 ms | |
#218 | Mistral-7B-Instruct-v0.1 | 7.3B | INT4 Q8 FP16 | 130 tok/s 87 tok/s 50 tok/s | ~518 ms ~522 ms ~531 ms | |
#219 | Llama 3.2 1B | 1B | INT4 Q8 FP16 | 289 tok/s 251 tok/s 194 tok/s | ~86 ms ~86 ms ~88 ms | |
#220 | Gemma 2 2B | 2B | INT4 Q8 FP16 | 239 tok/s 191 tok/s 132 tok/s | ~160 ms ~161 ms ~163 ms | |
#221 | Phi-3-medium | 14B | INT4 Q8 | 82 tok/s 51 tok/s | ~977 ms ~984 ms | |
#222 | OLMo 3 7B Instruct | 7B | INT4 Q8 FP16 | 101 tok/s 75 tok/s 46 tok/s | ~501 ms ~504 ms ~512 ms | |
#223 | Yi-34B | 34B | INT4 | 28 tok/s | ~2.7s | |
#224 | Qwen2-7B | 7B | INT4 Q8 FP16 | 134 tok/s 89 tok/s 52 tok/s | ~498 ms ~502 ms ~510 ms | |
#225 | Phi-3-small | 7B | INT4 Q8 FP16 | 134 tok/s 89 tok/s 52 tok/s | ~498 ms ~502 ms ~510 ms | |
#226 | Gemma 3 1B | 1B | INT4 Q8 FP16 | 289 tok/s 251 tok/s 194 tok/s | ~86 ms ~86 ms ~88 ms | |
#227 | Mistral-7B-Instruct-v0.2 | 7.3B | INT4 Q8 FP16 | 130 tok/s 87 tok/s 50 tok/s | ~518 ms ~522 ms ~531 ms | |
#229 | Gemma 1 7B | 7B | INT4 Q8 FP16 | 101 tok/s 75 tok/s 46 tok/s | ~501 ms ~504 ms ~512 ms | |
#230 | Gemma 1 2B | 2B | INT4 Q8 FP16 | 249 tok/s 197 tok/s 135 tok/s | ~159 ms ~161 ms ~163 ms | |
#231 | ChatGLM3-6B | 6B | INT4 Q8 FP16 | 111 tok/s 83 tok/s 53 tok/s | ~433 ms ~436 ms ~443 ms | |
#232 | ChatGLM2-6B | 6B | INT4 Q8 FP16 | 111 tok/s 83 tok/s 53 tok/s | ~433 ms ~436 ms ~443 ms | |
#233 | ChatGLM-6B | 6B | INT4 Q8 FP16 | 111 tok/s 83 tok/s 53 tok/s | ~433 ms ~436 ms ~443 ms | |
未上榜模型(按推理速度排序) | ||||||
- | Qwen2-0.5B | 0.5B | INT4 Q8 FP16 | 326 tok/s 301 tok/s 256 tok/s | ~45 ms ~45 ms ~46 ms | |
- | Qwen2.5-0.5B | 0.5B | INT4 Q8 FP16 | 326 tok/s 301 tok/s 256 tok/s | ~45 ms ~45 ms ~46 ms | |
- | ERNIE-4.5-0.3B | 0.3B | INT4 Q8 FP16 | 323 tok/s 309 tok/s 279 tok/s | ~30 ms ~30 ms ~31 ms | |
- | ERNIE-4.5-0.3B-Base | 0.3B | INT4 Q8 FP16 | 323 tok/s 309 tok/s 279 tok/s | ~30 ms ~30 ms ~31 ms | |
- | Falcon-1B | 1B | INT4 Q8 FP16 | 297 tok/s 257 tok/s 198 tok/s | ~86 ms ~86 ms ~87 ms | |
- | Falcon3-1B | 1B | INT4 Q8 FP16 | 289 tok/s 251 tok/s 194 tok/s | ~86 ms ~86 ms ~88 ms | |
- | Qwen2-1.5B | 1.5B | INT4 Q8 FP16 | 262 tok/s 217 tok/s 157 tok/s | ~122 ms ~123 ms ~125 ms | |
- | Qwen2.5-1.5B | 1.5B | INT4 Q8 FP16 | 262 tok/s 217 tok/s 157 tok/s | ~122 ms ~123 ms ~125 ms | |
- | Spark X2.5 1.7B | 1.7B | INT4 Q8 FP16 | 252 tok/s 206 tok/s 146 tok/s | ~138 ms ~138 ms ~140 ms | |
- | Hy-MT2 1.8B | 1.8B | INT4 Q8 FP16 | 248 tok/s 201 tok/s 141 tok/s | ~144 ms ~145 ms ~148 ms | |
- | Falcon-3B | 3B | INT4 Q8 FP16 | 215 tok/s 160 tok/s 103 tok/s | ~227 ms ~228 ms ~232 ms | |
- | CroissantLLM Base | 1.3B | INT4 Q8 FP16 | 212 tok/s 188 tok/s 146 tok/s | ~109 ms ~109 ms ~111 ms | |
- | Phi-1 | 1.3B | INT4 Q8 FP16 | 212 tok/s 188 tok/s 146 tok/s | ~109 ms ~109 ms ~111 ms | |
- | Phi-1.5 | 1.3B | INT4 Q8 FP16 | 212 tok/s 188 tok/s 146 tok/s | ~109 ms ~109 ms ~111 ms | |
- | DeepSeek-R1 3B | 3B | INT4 Q8 FP16 | 209 tok/s 157 tok/s 101 tok/s | ~227 ms ~229 ms ~232 ms | |
- | Falcon3-3B | 3B | INT4 Q8 FP16 | 207 tok/s 156 tok/s 101 tok/s | ~227 ms ~229 ms ~232 ms | |
- | Qwen2.5-3B | 3B | INT4 Q8 FP16 | 207 tok/s 156 tok/s 101 tok/s | ~227 ms ~229 ms ~232 ms | |
- | ERNIE-4.5-21B-A3B | 21B (3B active) | INT4 Q8 | 188 tok/s 131 tok/s | ~276 ms ~325 ms | |
- | ERNIE-4.5-21B-A3B-Base | 21B (3B active) | INT4 Q8 | 188 tok/s 131 tok/s | ~276 ms ~325 ms | |
- | ERNIE-4.5-VL-28B-A3B | 28B (3B active) | INT4 | 183 tok/s | ~290 ms | |
- | ERNIE-4.5-VL-28B-A3B-Base | 28B (3B active) | INT4 | 183 tok/s | ~290 ms | |
- | Hy-MT2 30B A3B | 30B (3B active) | INT4 | 182 tok/s | ~294 ms | |
- | Spark X2.5 4B | 4B | INT4 Q8 FP16 | 182 tok/s 131 tok/s 81 tok/s | ~295 ms ~297 ms ~302 ms | |
- | Phi-2 | 2.7B | INT4 Q8 FP16 | 160 tok/s 133 tok/s 94 tok/s | ~208 ms ~210 ms ~213 ms | |
- | MaLLaM-3B | 3B | INT4 Q8 FP16 | 154 tok/s 126 tok/s 88 tok/s | ~229 ms ~230 ms ~234 ms | |
- | SmolLM3 3B | 3B | INT4 Q8 FP16 | 154 tok/s 126 tok/s 88 tok/s | ~229 ms ~230 ms ~234 ms | |
- | Falcon-7B | 7B | INT4 Q8 FP16 | 138 tok/s 91 tok/s 52 tok/s | ~498 ms ~502 ms ~510 ms | |
- | Falcon3-7B | 7B | INT4 Q8 FP16 | 134 tok/s 89 tok/s 52 tok/s | ~498 ms ~502 ms ~510 ms | |
- | Hy-MT2 7B | 7B | INT4 Q8 FP16 | 134 tok/s 89 tok/s 52 tok/s | ~498 ms ~502 ms ~510 ms | |
- | Mistral-7B-v0.1 | 7.3B | INT4 Q8 FP16 | 130 tok/s 87 tok/s 50 tok/s | ~518 ms ~522 ms ~531 ms | |
- | LensVLM 9B | 9B | INT4 Q8 FP16 | 113 tok/s 74 tok/s 39 tok/s | ~635 ms ~640 ms ~705 ms | |
- | MiMo V2.6 Distill Qwen 9B | 9B | INT4 Q8 FP16 | 113 tok/s 74 tok/s 39 tok/s | ~635 ms ~640 ms ~705 ms | |
- | ChatGLM3-6B-32K | 6B | INT4 Q8 FP16 | 111 tok/s 83 tok/s 53 tok/s | ~433 ms ~436 ms ~443 ms | |
- | Yi-6B | 6B | INT4 Q8 FP16 | 111 tok/s 83 tok/s 53 tok/s | ~433 ms ~436 ms ~443 ms | |
- | Falcon3-10B | 10B | INT4 Q8 FP16 | 106 tok/s 68 tok/s 36 tok/s | ~703 ms ~708 ms ~781 ms | |
- | Kimi-VL-A3B-Instruct | 16B (3B active) | INT4 Q8 | 106 tok/s 89 tok/s | ~269 ms ~293 ms | |
- | Falcon2-11B | 11B | INT4 Q8 FP16 | 102 tok/s 64 tok/s 32 tok/s | ~771 ms ~776 ms ~925 ms | |
- | Hunyuan Lite | 7B | INT4 Q8 FP16 | 101 tok/s 75 tok/s 46 tok/s | ~501 ms ~504 ms ~512 ms | |
- | OLMo 3 7B Base | 7B | INT4 Q8 FP16 | 101 tok/s 75 tok/s 46 tok/s | ~501 ms ~504 ms ~512 ms | |
- | SEA-LION-7B | 7.1B | INT4 Q8 FP16 | 101 tok/s 74 tok/s 46 tok/s | ~507 ms ~511 ms ~519 ms | |
- | SEA-LION-7B-Instruct | 7.1B | INT4 Q8 FP16 | 101 tok/s 74 tok/s 46 tok/s | ~507 ms ~511 ms ~519 ms | |
- | Sahabat-AI-Llama3-8B-Instruct | 8B | INT4 Q8 FP16 | 93 tok/s 68 tok/s 39 tok/s | ~569 ms ~573 ms ~631 ms | |
- | Typhoon-2-8B | 8B | INT4 Q8 FP16 | 93 tok/s 68 tok/s 39 tok/s | ~569 ms ~573 ms ~631 ms | |
- | GLM-4-9B | 9B | INT4 Q8 FP16 | 86 tok/s 62 tok/s 36 tok/s | ~638 ms ~642 ms ~708 ms | |
- | GLM-4-9B-Chat | 9B | INT4 Q8 FP16 | 86 tok/s 62 tok/s 36 tok/s | ~638 ms ~642 ms ~708 ms | |
- | GLM-4-9B-Chat-1M | 9B | INT4 Q8 FP16 | 86 tok/s 62 tok/s 36 tok/s | ~638 ms ~642 ms ~708 ms | |
- | Yi-9B | 9B | INT4 Q8 FP16 | 86 tok/s 62 tok/s 36 tok/s | ~638 ms ~642 ms ~708 ms | |
- | Sahabat-AI-Gemma2-9B | 9.2B | INT4 Q8 FP16 | 85 tok/s 61 tok/s 35 tok/s | ~651 ms ~656 ms ~723 ms | |
- | Sahabat-AI-Gemma2-9B-Instruct | 9.2B | INT4 Q8 FP16 | 85 tok/s 61 tok/s 35 tok/s | ~651 ms ~656 ms ~723 ms | |
- | GreenMind-14B-R1 | 14B | INT4 Q8 | 62 tok/s 43 tok/s | ~981 ms ~988 ms | |
- | Falcon-40B | 40B | INT4 | 34 tok/s | ~3.0s | |
不同量化精度下可运行的最大模型参数级别。
上下文长度:
4位量化
32B 模型
8位精度
14B 模型
16位全精度
8B 模型
本地模型训练与适配器微调支持能力。
微调上下文:
QLoRA
32B 模型
LoRA
14B 模型
全参数微调
3B 模型
NVIDIA RTX 3090 Ti (24GB) 上的最佳量化精度与运行规格建议。
最佳推理区间
适合在全精度或 Q8 精度下运行 14B 模型,以及在 Q4 精度下搭配最高 32k 上下文运行 32B 模型。
显存带宽与推理速率
具备 1008 GB/s 聚合带宽,单批次推理处于显存带宽受限模式。8B Q4 模型预估生成速度约 224 tok/s,70B Q4 模型预估生成速度约 27 tok/s。
Assistant
在线