趋近智
NVIDIA RTX 3080 (12GB) 配备 12 GB 专用显存与 912 GB/s 显存带宽,支持 CUDA 和 TensorRT-LLM 运行环境,可进行全精度与量化大模型推理。
总显存
12 GB
可用显存上限
12 GB
显存带宽
912 GB/s
最大推理模型级别
14B 模型 (Q4)
热设计功耗
350W
随上下文长度增长的显存需求评估。当曲线超过参考线时将导致显存不足(OOM)。
量化精度:
主流开源大模型在 NVIDIA RTX 3080 (12GB) 上的推理速度、显存兼容性与生成吞吐表现。
排序:
上下文长度:
KV 缓存:
显卡数量:
| 排名 | 模型 | 参数量 | 量化精度 | 预估 TPS | TTFT | 可运行 |
|---|---|---|---|---|---|---|
#100 | Phi-4 Reasoning Plus | 14B | INT4 | 52 tok/s | ~1.5s | |
#109 | Gemma 4 12B | 11.95B | INT4 | 61 tok/s | ~1.2s | |
#113 | Qwen3.5-9B | 9B | INT4 Q8 | 106 tok/s 65 tok/s | ~824 ms ~900 ms | |
#118 | K2 Horizon 7B | 7B | INT4 Q8 | 125 tok/s 83 tok/s | ~646 ms ~650 ms | |
#128 | NVIDIA Nemotron 3 Nano 30B-A3B | 3.5B (30B active) | INT4 Q8 FP16 | 39 tok/s 23 tok/s 12 tok/s | ~2.6s ~2.6s ~2.9s | |
#132 | Qwen3.5-4B | 4B | INT4 Q8 FP16 | 173 tok/s 123 tok/s 75 tok/s | ~381 ms ~384 ms ~389 ms | |
#146 | Granite 4.2 8B | 8B | INT4 Q8 | 115 tok/s 71 tok/s | ~734 ms ~802 ms | |
#150 | Gemma 4 E4B | 8B | INT4 Q8 | 115 tok/s 71 tok/s | ~734 ms ~802 ms | |
#158 | GLM-4V | 9B | INT4 | 80 tok/s | ~827 ms | |
#160 | Phi-4 | 14B | INT4 | 76 tok/s | ~1.3s | |
#169 | OLMo 3 7B Think | 7B | INT4 Q8 | 94 tok/s 66 tok/s | ~649 ms ~708 ms | |
#172 | DeepSeek-R1 14B | 14B | INT4 | 78 tok/s | ~1.3s | |
#173 | Ministral 3 14B | 14B | INT4 | 52 tok/s | ~1.5s | |
#177 | Gemma 3 12B | 12B | INT4 | 86 tok/s | ~1.1s | |
#182 | Ministral 3 8B | 8B | INT4 Q8 | 87 tok/s 56 tok/s | ~737 ms ~870 ms | |
#183 | Qwen3.5-2B | 2B | INT4 Q8 FP16 | 231 tok/s 182 tok/s 124 tok/s | ~205 ms ~207 ms ~209 ms | |
#184 | MiniCPM5-2B | 2B | INT4 Q8 FP16 | 231 tok/s 182 tok/s 124 tok/s | ~205 ms ~207 ms ~209 ms | |
#185 | Qwen2.5-14B | 14B | INT4 | 76 tok/s | ~1.3s | |
#188 | Gemma 4 E2B | 5.1B | INT4 Q8 FP16 | 152 tok/s 104 tok/s 56 tok/s | ~478 ms ~481 ms ~572 ms | |
#189 | Qwen3-4B | 4B | INT4 Q8 FP16 | 173 tok/s 123 tok/s 75 tok/s | ~381 ms ~384 ms ~389 ms | |
#190 | DeepSeek-R1 8B | 8B | INT4 Q8 | 117 tok/s 76 tok/s | ~734 ms ~739 ms | |
#193 | Ministral 3 3B | 3B | INT4 Q8 FP16 | 145 tok/s 118 tok/s 81 tok/s | ~295 ms ~296 ms ~300 ms | |
#195 | Qwen3-14B | 14B | INT4 | 76 tok/s | ~1.3s | |
#197 | Gemma 2 9B | 9B | INT4 Q8 | 106 tok/s 65 tok/s | ~824 ms ~900 ms | |
#198 | Qwen2.5-7B | 7B | INT4 Q8 | 125 tok/s 83 tok/s | ~646 ms ~650 ms | |
#199 | Qwen3-8B | 8B | INT4 Q8 | 115 tok/s 71 tok/s | ~734 ms ~802 ms | |
#200 | Gemma 3 4B | 4B | INT4 Q8 FP16 | 173 tok/s 123 tok/s 75 tok/s | ~381 ms ~384 ms ~389 ms | |
#201 | DeepSeek-R1 7B | 7B | INT4 Q8 | 128 tok/s 84 tok/s | ~646 ms ~650 ms | |
#202 | Llama 3.1 8B | 8B | INT4 Q8 | 115 tok/s 71 tok/s | ~734 ms ~802 ms | |
#204 | Qwen3-1.7B | 1.7B | INT4 Q8 FP16 | 244 tok/s 197 tok/s 137 tok/s | ~177 ms ~178 ms ~180 ms | |
#206 | Gemma 3 270M | 0.27B | INT4 Q8 FP16 | 325 tok/s 310 tok/s 280 tok/s | ~34 ms ~34 ms ~34 ms | |
#208 | Llama 3 8B | 8B | INT4 Q8 | 115 tok/s 71 tok/s | ~734 ms ~802 ms | |
#209 | Qwen3-0.6B | 0.6B | INT4 Q8 FP16 | 314 tok/s 283 tok/s 232 tok/s | ~66 ms ~67 ms ~68 ms | |
#210 | Phi-4-Mini | 3.8B | INT4 Q8 FP16 | 177 tok/s 127 tok/s 78 tok/s | ~364 ms ~366 ms ~371 ms | |
#212 | Ministral-8B-2410 | 8B | INT4 Q8 | 115 tok/s 71 tok/s | ~734 ms ~802 ms | |
#213 | DeepSeek-R1 1.5B | 1.5B | INT4 Q8 FP16 | 254 tok/s 208 tok/s 148 tok/s | ~157 ms ~158 ms ~160 ms | |
#214 | Llama 3.2 3B | 3B | INT4 Q8 FP16 | 198 tok/s 147 tok/s 94 tok/s | ~293 ms ~295 ms ~299 ms | |
#215 | Qwen3.5-0.8B | 0.8B | INT4 Q8 FP16 | 298 tok/s 262 tok/s 206 tok/s | ~88 ms ~88 ms ~89 ms | |
#216 | Phi-3-mini | 3.8B | INT4 Q8 FP16 | 177 tok/s 127 tok/s 78 tok/s | ~364 ms ~366 ms ~371 ms | |
#217 | Gemma 3n E2B IT | 6B (2B active) | INT4 Q8 | 145 tok/s 128 tok/s | ~221 ms ~222 ms | |
#218 | Mistral-7B-Instruct-v0.1 | 7.3B | INT4 Q8 | 122 tok/s 80 tok/s | ~672 ms ~676 ms | |
#219 | Llama 3.2 1B | 1B | INT4 Q8 FP16 | 282 tok/s 243 tok/s 185 tok/s | ~109 ms ~110 ms ~111 ms | |
#220 | Gemma 2 2B | 2B | INT4 Q8 FP16 | 231 tok/s 182 tok/s 124 tok/s | ~205 ms ~207 ms ~209 ms | |
#221 | Phi-3-medium | 14B | INT4 | 76 tok/s | ~1.3s | |
#222 | OLMo 3 7B Instruct | 7B | INT4 Q8 | 94 tok/s 66 tok/s | ~649 ms ~708 ms | |
#224 | Qwen2-7B | 7B | INT4 Q8 | 125 tok/s 83 tok/s | ~646 ms ~650 ms | |
#225 | Phi-3-small | 7B | INT4 Q8 | 125 tok/s 83 tok/s | ~646 ms ~650 ms | |
#226 | Gemma 3 1B | 1B | INT4 Q8 FP16 | 282 tok/s 243 tok/s 185 tok/s | ~109 ms ~110 ms ~111 ms | |
#227 | Mistral-7B-Instruct-v0.2 | 7.3B | INT4 Q8 | 122 tok/s 80 tok/s | ~672 ms ~676 ms | |
#229 | Gemma 1 7B | 7B | INT4 Q8 | 94 tok/s 66 tok/s | ~649 ms ~708 ms | |
#230 | Gemma 1 2B | 2B | INT4 Q8 FP16 | 240 tok/s 188 tok/s 126 tok/s | ~205 ms ~206 ms ~209 ms | |
#231 | ChatGLM3-6B | 6B | INT4 Q8 | 103 tok/s 77 tok/s | ~560 ms ~563 ms | |
#232 | ChatGLM2-6B | 6B | INT4 Q8 | 103 tok/s 77 tok/s | ~560 ms ~563 ms | |
#233 | ChatGLM-6B | 6B | INT4 Q8 | 103 tok/s 77 tok/s | ~560 ms ~563 ms | |
未上榜模型(按推理速度排序) | ||||||
- | Qwen2-0.5B | 0.5B | INT4 Q8 FP16 | 322 tok/s 295 tok/s 248 tok/s | ~56 ms ~57 ms ~57 ms | |
- | Qwen2.5-0.5B | 0.5B | INT4 Q8 FP16 | 322 tok/s 295 tok/s 248 tok/s | ~56 ms ~57 ms ~57 ms | |
- | ERNIE-4.5-0.3B | 0.3B | INT4 Q8 FP16 | 319 tok/s 304 tok/s 272 tok/s | ~37 ms ~37 ms ~37 ms | |
- | ERNIE-4.5-0.3B-Base | 0.3B | INT4 Q8 FP16 | 319 tok/s 304 tok/s 272 tok/s | ~37 ms ~37 ms ~37 ms | |
- | Falcon-1B | 1B | INT4 Q8 FP16 | 291 tok/s 249 tok/s 188 tok/s | ~109 ms ~110 ms ~111 ms | |
- | Falcon3-1B | 1B | INT4 Q8 FP16 | 282 tok/s 243 tok/s 185 tok/s | ~109 ms ~110 ms ~111 ms | |
- | Qwen2-1.5B | 1.5B | INT4 Q8 FP16 | 254 tok/s 208 tok/s 148 tok/s | ~157 ms ~158 ms ~160 ms | |
- | Qwen2.5-1.5B | 1.5B | INT4 Q8 FP16 | 254 tok/s 208 tok/s 148 tok/s | ~157 ms ~158 ms ~160 ms | |
- | Spark X2.5 1.7B | 1.7B | INT4 Q8 FP16 | 244 tok/s 197 tok/s 137 tok/s | ~177 ms ~178 ms ~180 ms | |
- | Hy-MT2 1.8B | 1.8B | INT4 Q8 FP16 | 240 tok/s 192 tok/s 133 tok/s | ~186 ms ~187 ms ~189 ms | |
- | Falcon-3B | 3B | INT4 Q8 FP16 | 206 tok/s 151 tok/s 95 tok/s | ~293 ms ~294 ms ~298 ms | |
- | CroissantLLM Base | 1.3B | INT4 Q8 FP16 | 203 tok/s 179 tok/s 138 tok/s | ~139 ms ~139 ms ~141 ms | |
- | Phi-1 | 1.3B | INT4 Q8 FP16 | 203 tok/s 179 tok/s 138 tok/s | ~139 ms ~139 ms ~141 ms | |
- | Phi-1.5 | 1.3B | INT4 Q8 FP16 | 203 tok/s 179 tok/s 138 tok/s | ~139 ms ~139 ms ~141 ms | |
- | DeepSeek-R1 3B | 3B | INT4 Q8 FP16 | 199 tok/s 148 tok/s 94 tok/s | ~293 ms ~295 ms ~298 ms | |
- | Falcon3-3B | 3B | INT4 Q8 FP16 | 198 tok/s 147 tok/s 94 tok/s | ~293 ms ~295 ms ~299 ms | |
- | Qwen2.5-3B | 3B | INT4 Q8 FP16 | 198 tok/s 147 tok/s 94 tok/s | ~293 ms ~295 ms ~299 ms | |
- | Spark X2.5 4B | 4B | INT4 Q8 FP16 | 173 tok/s 123 tok/s 75 tok/s | ~381 ms ~384 ms ~389 ms | |
- | Phi-2 | 2.7B | INT4 Q8 FP16 | 151 tok/s 124 tok/s 87 tok/s | ~268 ms ~270 ms ~273 ms | |
- | MaLLaM-3B | 3B | INT4 Q8 FP16 | 145 tok/s 118 tok/s 81 tok/s | ~295 ms ~296 ms ~300 ms | |
- | SmolLM3 3B | 3B | INT4 Q8 FP16 | 145 tok/s 118 tok/s 81 tok/s | ~295 ms ~296 ms ~300 ms | |
- | Falcon-7B | 7B | INT4 Q8 | 130 tok/s 85 tok/s | ~646 ms ~650 ms | |
- | Falcon3-7B | 7B | INT4 Q8 | 125 tok/s 83 tok/s | ~646 ms ~650 ms | |
- | Hy-MT2 7B | 7B | INT4 Q8 | 125 tok/s 83 tok/s | ~646 ms ~650 ms | |
- | Mistral-7B-v0.1 | 7.3B | INT4 Q8 | 122 tok/s 80 tok/s | ~672 ms ~676 ms | |
- | LensVLM 9B | 9B | INT4 Q8 | 106 tok/s 65 tok/s | ~824 ms ~900 ms | |
- | MiMo V2.6 Distill Qwen 9B | 9B | INT4 Q8 | 106 tok/s 65 tok/s | ~824 ms ~900 ms | |
- | ChatGLM3-6B-32K | 6B | INT4 Q8 | 103 tok/s 77 tok/s | ~560 ms ~563 ms | |
- | Yi-6B | 6B | INT4 Q8 | 103 tok/s 77 tok/s | ~560 ms ~563 ms | |
- | Falcon3-10B | 10B | INT4 Q8 | 98 tok/s 56 tok/s | ~912 ms ~1.1s | |
- | Falcon2-11B | 11B | INT4 Q8 | 95 tok/s 53 tok/s | ~1.0s ~1.2s | |
- | Hunyuan Lite | 7B | INT4 Q8 | 94 tok/s 66 tok/s | ~649 ms ~708 ms | |
- | OLMo 3 7B Base | 7B | INT4 Q8 | 94 tok/s 66 tok/s | ~649 ms ~708 ms | |
- | SEA-LION-7B | 7.1B | INT4 Q8 | 93 tok/s 65 tok/s | ~657 ms ~717 ms | |
- | SEA-LION-7B-Instruct | 7.1B | INT4 Q8 | 93 tok/s 65 tok/s | ~657 ms ~717 ms | |
- | Sahabat-AI-Llama3-8B-Instruct | 8B | INT4 Q8 | 87 tok/s 56 tok/s | ~737 ms ~870 ms | |
- | Typhoon-2-8B | 8B | INT4 Q8 | 87 tok/s 56 tok/s | ~737 ms ~870 ms | |
- | GLM-4-9B | 9B | INT4 | 80 tok/s | ~827 ms | |
- | GLM-4-9B-Chat | 9B | INT4 | 80 tok/s | ~827 ms | |
- | GLM-4-9B-Chat-1M | 9B | INT4 | 80 tok/s | ~827 ms | |
- | Yi-9B | 9B | INT4 | 80 tok/s | ~827 ms | |
- | Sahabat-AI-Gemma2-9B | 9.2B | INT4 | 78 tok/s | ~844 ms | |
- | Sahabat-AI-Gemma2-9B-Instruct | 9.2B | INT4 | 78 tok/s | ~844 ms | |
- | GreenMind-14B-R1 | 14B | INT4 | 52 tok/s | ~1.5s | |
不同量化精度下可运行的最大模型参数级别。
上下文长度:
4位量化
14B 模型
8位精度
8B 模型
16位全精度
3B 模型
本地模型训练与适配器微调支持能力。
微调上下文:
QLoRA
14B 模型
LoRA
8B 模型
全参数微调
1B 模型
NVIDIA RTX 3080 (12GB) 上的最佳量化精度与运行规格建议。
最佳推理区间
非常适合 8B 模型长上下文推理(32k+)。14B 模型在 Q4 精度及标准上下文下也能流畅运行。
显存带宽与推理速率
具备 912 GB/s 聚合带宽,单批次推理处于显存带宽受限模式。8B Q4 模型预估生成速度约 203 tok/s,70B Q4 模型预估生成速度约 24 tok/s。
Assistant
在线