趋近智
NVIDIA H200 (141GB) 配备 141 GB 专用显存与 4800 GB/s 显存带宽,支持 CUDA 和 TensorRT-LLM 运行环境,可进行全精度与量化大模型推理。
总显存
141 GB
可用显存上限
141 GB
显存带宽
4800 GB/s
最大推理模型级别
70B+ 模型 (Q4)
热设计功耗
700W
随上下文长度增长的显存需求评估。当曲线超过参考线时将导致显存不足(OOM)。
量化精度:
主流开源大模型在 NVIDIA H200 (141GB) 上的推理速度、显存兼容性与生成吞吐表现。
排序:
上下文长度:
KV 缓存:
显卡数量:
| 排名 | 模型 | 参数量 | 量化精度 | 预估 TPS | TTFT | 可运行 |
|---|---|---|---|---|---|---|
#30 | DeepSeek-V4-Flash-Vision-Exp | 290.9B (20.4B active) | INT4 | 204 tok/s | ~295 ms | |
#33 | Qwen 3.8 27B | 27B | INT4 Q8 FP16 | 182 tok/s 115 tok/s 64 tok/s | ~345 ms ~348 ms ~355 ms | |
#41 | Qwen 3.8 Flash | 176B (6B active) | INT4 | 422 tok/s | ~77 ms | |
#42 | DeepSeek-V4-Flash | 284B (13B active) | INT4 | 267 tok/s | ~190 ms | |
#48 | Agnes 3.0 Flash | 33B | INT4 Q8 FP16 | 157 tok/s 97 tok/s 53 tok/s | ~419 ms ~423 ms ~432 ms | |
#61 | Sarvam-105B | 106B (10.3B active) | INT4 Q8 | 325 tok/s 233 tok/s | ~178 ms ~179 ms | |
#72 | K2 Horizon MoVA 36B A4B | 36B (4B active) | INT4 Q8 FP16 | 438 tok/s 365 tok/s 264 tok/s | ~70 ms ~71 ms ~72 ms | |
#75 | Ling 3.0 Flash VL | 124B (5.5B active) | INT4 Q8 | 416 tok/s 311 tok/s | ~127 ms ~139 ms | |
#82 | Qwen3 235B A22B Thinking | 235B (22B active) | INT4 | 75 tok/s | ~414 ms | |
#83 | Qwen3.5-27B | 27B | INT4 Q8 FP16 | 182 tok/s 115 tok/s 64 tok/s | ~345 ms ~348 ms ~355 ms | |
#84 | Qwen3.5-122B-A10B | 122B (10B active) | INT4 Q8 | 278 tok/s 201 tok/s | ~182 ms ~199 ms | |
#92 | Sarvam-30B | 32B (2.4B active) | INT4 Q8 FP16 | 489 tok/s 432 tok/s 340 tok/s | ~50 ms ~50 ms ~51 ms | |
#94 | Qwen3.6 35B A3B | 35B (3B active) | INT4 Q8 FP16 | 468 tok/s 404 tok/s 307 tok/s | ~58 ms ~58 ms ~59 ms | |
#96 | Muse Glimmer 30B | 30B | INT4 Q8 FP16 | 168 tok/s 105 tok/s 58 tok/s | ~382 ms ~386 ms ~394 ms | |
#100 | Phi-4 Reasoning Plus | 14B | INT4 Q8 FP16 | 223 tok/s 165 tok/s 103 tok/s | ~184 ms ~186 ms ~189 ms | |
#101 | MiMo V2 Flash | 15B (309B active) | INT4 Q8 FP16 | 22 tok/s 12 tok/s 6 tok/s | ~3.7s ~3.8s ~3.9s | |
#106 | GLM-4.5-Air | 106B (12B active) | INT4 Q8 | 126 tok/s 106 tok/s | ~203 ms ~221 ms | |
#108 | Gemma 4 26B A4B | 25.2B (3.8B active) | INT4 Q8 FP16 | 451 tok/s 377 tok/s 275 tok/s | ~64 ms ~65 ms ~66 ms | |
#109 | Gemma 4 12B | 11.95B | INT4 Q8 FP16 | 245 tok/s 184 tok/s 117 tok/s | ~158 ms ~159 ms ~162 ms | |
#111 | MiniMax M2 | 229B (10B active) | INT4 | 89 tok/s | ~241 ms | |
#113 | Qwen3.5-9B | 9B | INT4 Q8 FP16 | 349 tok/s 255 tok/s 159 tok/s | ~120 ms ~121 ms ~123 ms | |
#114 | Qwen3.5-35B-A3B | 35B (3B active) | INT4 Q8 FP16 | 468 tok/s 404 tok/s 307 tok/s | ~58 ms ~58 ms ~59 ms | |
#114 | Ling 3.0 Flash | 124B (5.1B active) | INT4 Q8 | 426 tok/s 322 tok/s | ~122 ms ~133 ms | |
#118 | K2 Horizon 7B | 7B | INT4 Q8 FP16 | 390 tok/s 295 tok/s 192 tok/s | ~94 ms ~95 ms ~97 ms | |
#119 | Step 3.5 Flash | 196.81B (11B active) | INT4 | 261 tok/s | ~201 ms | |
#126 | Qwen3 Next 80B A3B | 80B (79B active) | INT4 Q8 | 62 tok/s 40 tok/s | ~997 ms ~1.0s | |
#128 | NVIDIA Nemotron 3 Nano 30B-A3B | 3.5B (30B active) | INT4 Q8 FP16 | 162 tok/s 103 tok/s 57 tok/s | ~371 ms ~374 ms ~382 ms | |
#129 | Gemma 4 31B | 30.7B | INT4 Q8 FP16 | 165 tok/s 103 tok/s 57 tok/s | ~391 ms ~395 ms ~403 ms | |
#130 | GPT-OSS 120B | 117B (5.1B active) | INT4 Q8 | 133 tok/s 117 tok/s | ~126 ms ~147 ms | |
#131 | Nemotron 3.5 Lightning | 30B (3B active) | INT4 Q8 FP16 | 284 tok/s 267 tok/s 221 tok/s | ~58 ms ~58 ms ~59 ms | |
#132 | Qwen3.5-4B | 4B | INT4 Q8 FP16 | 471 tok/s 385 tok/s 275 tok/s | ~57 ms ~57 ms ~58 ms | |
#133 | Qwen3-30B-A3B | 30B (3B active) | INT4 Q8 FP16 | 471 tok/s 406 tok/s 308 tok/s | ~57 ms ~57 ms ~58 ms | |
#136 | GPT-OSS 20B | 21B (3.6B active) | INT4 Q8 FP16 | 305 tok/s 277 tok/s 220 tok/s | ~62 ms ~62 ms ~63 ms | |
#139 | Qwen3-235B-A22B | 235B (22B active) | INT4 | 172 tok/s | ~376 ms | |
#144 | Mistral Medium 3.5 128B | 128B | INT4 Q8 | 40 tok/s 23 tok/s | ~1.6s ~1.9s | |
#146 | Granite 4.2 8B | 8B | INT4 Q8 FP16 | 368 tok/s 273 tok/s 174 tok/s | ~107 ms ~108 ms ~110 ms | |
#150 | Gemma 4 E4B | 8B | INT4 Q8 FP16 | 368 tok/s 273 tok/s 174 tok/s | ~107 ms ~108 ms ~110 ms | |
#151 | Nemotron 3.5 Lightning 30B A3B | 30B (3B active) | INT4 Q8 FP16 | 471 tok/s 406 tok/s 308 tok/s | ~57 ms ~57 ms ~58 ms | |
#153 | Qwen3-32B | 32B | INT4 Q8 FP16 | 160 tok/s 100 tok/s 54 tok/s | ~407 ms ~411 ms ~419 ms | |
#154 | Qwen2.5-72B | 72B | INT4 Q8 FP16 | 83 tok/s 49 tok/s 23 tok/s | ~906 ms ~914 ms ~1.1s | |
#155 | Mistral Large 3 | 41B (675B active) | INT4 Q8 FP16 | 10 tok/s 6 tok/s 3 tok/s | ~8.2s ~8.3s ~8.4s | |
#156 | GLM-4 | 32B | INT4 Q8 FP16 | 130 tok/s 88 tok/s 51 tok/s | ~409 ms ~412 ms ~421 ms | |
#157 | DeepSeek-R1 70B | 70B | INT4 Q8 FP16 | 87 tok/s 50 tok/s 24 tok/s | ~880 ms ~888 ms ~1.1s | |
#158 | GLM-4V | 9B | INT4 Q8 FP16 | 286 tok/s 222 tok/s 146 tok/s | ~120 ms ~121 ms ~124 ms | |
#159 | Gemma 3 27B | 27B | INT4 Q8 FP16 | 182 tok/s 115 tok/s 64 tok/s | ~345 ms ~348 ms ~355 ms | |
#160 | Phi-4 | 14B | INT4 Q8 FP16 | 277 tok/s 190 tok/s 112 tok/s | ~183 ms ~185 ms ~188 ms | |
#161 | Llama 3.3 70B | 70B | INT4 Q8 FP16 | 85 tok/s 50 tok/s 23 tok/s | ~880 ms ~889 ms ~1.1s | |
#162 | DeepSeek-R1 32B | 32B | INT4 Q8 FP16 | 164 tok/s 101 tok/s 55 tok/s | ~407 ms ~411 ms ~419 ms | |
#163 | Hunyuan Standard | 52B (389B active) | INT4 Q8 FP16 | 17 tok/s 10 tok/s 5 tok/s | ~4.7s ~4.8s ~5.3s | |
#164 | Qwen2.5-32B | 32B | INT4 Q8 FP16 | 160 tok/s 100 tok/s 54 tok/s | ~407 ms ~411 ms ~419 ms | |
#168 | Magistral Small | 24B | INT4 Q8 FP16 | 159 tok/s 111 tok/s 65 tok/s | ~309 ms ~312 ms ~318 ms | |
#169 | OLMo 3 7B Think | 7B | INT4 Q8 FP16 | 323 tok/s 258 tok/s 175 tok/s | ~95 ms ~96 ms ~98 ms | |
#170 | OLMo 3.1 32B Instruct | 32B | INT4 Q8 FP16 | 130 tok/s 88 tok/s 51 tok/s | ~409 ms ~412 ms ~421 ms | |
#171 | Llama 3.1 70B | 70B | INT4 Q8 FP16 | 85 tok/s 50 tok/s 23 tok/s | ~880 ms ~889 ms ~1.1s | |
#172 | DeepSeek-R1 14B | 14B | INT4 Q8 FP16 | 283 tok/s 192 tok/s 113 tok/s | ~183 ms ~185 ms ~188 ms | |
#173 | Ministral 3 14B | 14B | INT4 Q8 FP16 | 223 tok/s 165 tok/s 103 tok/s | ~184 ms ~186 ms ~189 ms | |
#174 | Mistral-Large-2407 | 123B | INT4 Q8 | 51 tok/s 28 tok/s | ~1.5s ~1.7s | |
#175 | Llama 4 Scout | 109B (17B active) | INT4 Q8 | 222 tok/s 146 tok/s | ~260 ms ~284 ms | |
#177 | Gemma 3 12B | 12B | INT4 Q8 FP16 | 302 tok/s 212 tok/s 127 tok/s | ~158 ms ~159 ms ~162 ms | |
#178 | Command A | 111B | INT4 Q8 | 45 tok/s 27 tok/s | ~1.4s ~1.5s | |
#179 | Qwen2-72B | 72B | INT4 Q8 FP16 | 83 tok/s 49 tok/s 23 tok/s | ~906 ms ~914 ms ~1.1s | |
#180 | OLMo 3 32B Base | 32B | INT4 Q8 FP16 | 130 tok/s 88 tok/s 51 tok/s | ~409 ms ~412 ms ~421 ms | |
#181 | Mistral-Small-2501 | 24B | INT4 Q8 FP16 | 197 tok/s 126 tok/s 71 tok/s | ~308 ms ~311 ms ~317 ms | |
#182 | Ministral 3 8B | 8B | INT4 Q8 FP16 | 304 tok/s 239 tok/s 160 tok/s | ~108 ms ~108 ms ~111 ms | |
#183 | Qwen3.5-2B | 2B | INT4 Q8 FP16 | 546 tok/s 484 tok/s 387 tok/s | ~32 ms ~32 ms ~32 ms | |
#184 | MiniCPM5-2B | 2B | INT4 Q8 FP16 | 546 tok/s 484 tok/s 387 tok/s | ~32 ms ~32 ms ~32 ms | |
#185 | Qwen2.5-14B | 14B | INT4 Q8 FP16 | 277 tok/s 190 tok/s 112 tok/s | ~183 ms ~185 ms ~188 ms | |
#186 | Gemma 2 27B | 27B | INT4 Q8 FP16 | 182 tok/s 115 tok/s 64 tok/s | ~345 ms ~348 ms ~355 ms | |
#187 | OLMo 3.1 32B Think | 32B | INT4 Q8 FP16 | 130 tok/s 88 tok/s 51 tok/s | ~409 ms ~412 ms ~421 ms | |
#188 | Gemma 4 E2B | 5.1B | INT4 Q8 FP16 | 437 tok/s 346 tok/s 237 tok/s | ~71 ms ~71 ms ~72 ms | |
#189 | Qwen3-4B | 4B | INT4 Q8 FP16 | 471 tok/s 385 tok/s 275 tok/s | ~57 ms ~57 ms ~58 ms | |
#190 | DeepSeek-R1 8B | 8B | INT4 Q8 FP16 | 374 tok/s 276 tok/s 175 tok/s | ~107 ms ~108 ms ~110 ms | |
#191 | Llama 3 70B | 70B | INT4 Q8 FP16 | 85 tok/s 50 tok/s 23 tok/s | ~880 ms ~889 ms ~1.1s | |
#192 | Command R Plus | 104B | INT4 Q8 | 48 tok/s 29 tok/s | ~1.3s ~1.4s | |
#193 | Ministral 3 3B | 3B | INT4 Q8 FP16 | 427 tok/s 375 tok/s 290 tok/s | ~44 ms ~45 ms ~46 ms | |
#195 | Qwen3-14B | 14B | INT4 Q8 FP16 | 277 tok/s 190 tok/s 112 tok/s | ~183 ms ~185 ms ~188 ms | |
#196 | Kimi Linear 48B A3B Instruct | 48B (3B active) | INT4 Q8 FP16 | 255 tok/s 243 tok/s 204 tok/s | ~63 ms ~63 ms ~64 ms | |
#197 | Gemma 2 9B | 9B | INT4 Q8 FP16 | 349 tok/s 255 tok/s 159 tok/s | ~120 ms ~121 ms ~123 ms | |
#198 | Qwen2.5-7B | 7B | INT4 Q8 FP16 | 390 tok/s 295 tok/s 192 tok/s | ~94 ms ~95 ms ~97 ms | |
#199 | Qwen3-8B | 8B | INT4 Q8 FP16 | 368 tok/s 273 tok/s 174 tok/s | ~107 ms ~108 ms ~110 ms | |
#200 | Gemma 3 4B | 4B | INT4 Q8 FP16 | 471 tok/s 385 tok/s 275 tok/s | ~57 ms ~57 ms ~58 ms | |
#201 | DeepSeek-R1 7B | 7B | INT4 Q8 FP16 | 395 tok/s 297 tok/s 193 tok/s | ~94 ms ~95 ms ~97 ms | |
#202 | Llama 3.1 8B | 8B | INT4 Q8 FP16 | 368 tok/s 273 tok/s 174 tok/s | ~107 ms ~108 ms ~110 ms | |
#203 | Mixtral-8x22B-v0.1 | 176B (22B active) | INT4 | 189 tok/s | ~327 ms | |
#204 | Qwen3-1.7B | 1.7B | INT4 Q8 FP16 | 561 tok/s 505 tok/s 413 tok/s | ~28 ms ~28 ms ~28 ms | |
#205 | Command R | 35B | INT4 Q8 FP16 | 123 tok/s 82 tok/s 47 tok/s | ~445 ms ~449 ms ~458 ms | |
#206 | Gemma 3 270M | 0.27B | INT4 Q8 FP16 | 634 tok/s 623 tok/s 597 tok/s | ~7 ms ~7 ms ~7 ms | |
#208 | Llama 3 8B | 8B | INT4 Q8 FP16 | 368 tok/s 273 tok/s 174 tok/s | ~107 ms ~108 ms ~110 ms | |
#209 | Qwen3-0.6B | 0.6B | INT4 Q8 FP16 | 626 tok/s 599 tok/s 548 tok/s | ~12 ms ~12 ms ~12 ms | |
#210 | Phi-4-Mini | 3.8B | INT4 Q8 FP16 | 477 tok/s 393 tok/s 283 tok/s | ~54 ms ~55 ms ~56 ms | |
#211 | Mixtral-8x7B-v0.1 | 46.7B (7B active) | INT4 Q8 FP16 | 365 tok/s 282 tok/s 186 tok/s | ~109 ms ~110 ms ~112 ms | |
#212 | Ministral-8B-2410 | 8B | INT4 Q8 FP16 | 368 tok/s 273 tok/s 174 tok/s | ~107 ms ~108 ms ~110 ms | |
#213 | DeepSeek-R1 1.5B | 1.5B | INT4 Q8 FP16 | 572 tok/s 519 tok/s 432 tok/s | ~25 ms ~25 ms ~25 ms | |
#214 | Llama 3.2 3B | 3B | INT4 Q8 FP16 | 506 tok/s 429 tok/s 321 tok/s | ~44 ms ~44 ms ~45 ms | |
#215 | Qwen3.5-0.8B | 0.8B | INT4 Q8 FP16 | 612 tok/s 579 tok/s 517 tok/s | ~15 ms ~15 ms ~15 ms | |
#216 | Phi-3-mini | 3.8B | INT4 Q8 FP16 | 477 tok/s 393 tok/s 283 tok/s | ~54 ms ~55 ms ~56 ms | |
#217 | Gemma 3n E2B IT | 6B (2B active) | INT4 Q8 FP16 | 427 tok/s 394 tok/s 327 tok/s | ~34 ms ~34 ms ~35 ms | |
#218 | Mistral-7B-Instruct-v0.1 | 7.3B | INT4 Q8 FP16 | 383 tok/s 288 tok/s 186 tok/s | ~98 ms ~99 ms ~101 ms | |
#219 | Llama 3.2 1B | 1B | INT4 Q8 FP16 | 599 tok/s 560 tok/s 489 tok/s | ~18 ms ~18 ms ~18 ms | |
#220 | Gemma 2 2B | 2B | INT4 Q8 FP16 | 546 tok/s 484 tok/s 387 tok/s | ~32 ms ~32 ms ~32 ms | |
#221 | Phi-3-medium | 14B | INT4 Q8 FP16 | 277 tok/s 190 tok/s 112 tok/s | ~183 ms ~185 ms ~188 ms | |
#222 | OLMo 3 7B Instruct | 7B | INT4 Q8 FP16 | 323 tok/s 258 tok/s 175 tok/s | ~95 ms ~96 ms ~98 ms | |
#223 | Yi-34B | 34B | INT4 Q8 FP16 | 125 tok/s 84 tok/s 48 tok/s | ~433 ms ~437 ms ~446 ms | |
#224 | Qwen2-7B | 7B | INT4 Q8 FP16 | 390 tok/s 295 tok/s 192 tok/s | ~94 ms ~95 ms ~97 ms | |
#225 | Phi-3-small | 7B | INT4 Q8 FP16 | 390 tok/s 295 tok/s 192 tok/s | ~94 ms ~95 ms ~97 ms | |
#226 | Gemma 3 1B | 1B | INT4 Q8 FP16 | 599 tok/s 560 tok/s 489 tok/s | ~18 ms ~18 ms ~18 ms | |
#227 | Mistral-7B-Instruct-v0.2 | 7.3B | INT4 Q8 FP16 | 383 tok/s 288 tok/s 186 tok/s | ~98 ms ~99 ms ~101 ms | |
#228 | Falcon-180B | 180B | INT4 | 37 tok/s | ~2.2s | |
#229 | Gemma 1 7B | 7B | INT4 Q8 FP16 | 323 tok/s 258 tok/s 175 tok/s | ~95 ms ~96 ms ~98 ms | |
#230 | Gemma 1 2B | 2B | INT4 Q8 FP16 | 557 tok/s 492 tok/s 392 tok/s | ~32 ms ~32 ms ~32 ms | |
#231 | ChatGLM3-6B | 6B | INT4 Q8 FP16 | 344 tok/s 279 tok/s 195 tok/s | ~82 ms ~83 ms ~85 ms | |
#232 | ChatGLM2-6B | 6B | INT4 Q8 FP16 | 344 tok/s 279 tok/s 195 tok/s | ~82 ms ~83 ms ~85 ms | |
#233 | ChatGLM-6B | 6B | INT4 Q8 FP16 | 344 tok/s 279 tok/s 195 tok/s | ~82 ms ~83 ms ~85 ms | |
未上榜模型(按推理速度排序) | ||||||
- | Qwen2-0.5B | 0.5B | INT4 Q8 FP16 | 632 tok/s 610 tok/s 565 tok/s | ~10 ms ~10 ms ~11 ms | |
- | Qwen2.5-0.5B | 0.5B | INT4 Q8 FP16 | 632 tok/s 610 tok/s 565 tok/s | ~10 ms ~10 ms ~11 ms | |
- | ERNIE-4.5-0.3B | 0.3B | INT4 Q8 FP16 | 630 tok/s 617 tok/s 589 tok/s | ~8 ms ~8 ms ~8 ms | |
- | ERNIE-4.5-0.3B-Base | 0.3B | INT4 Q8 FP16 | 630 tok/s 617 tok/s 589 tok/s | ~8 ms ~8 ms ~8 ms | |
- | Falcon-1B | 1B | INT4 Q8 FP16 | 607 tok/s 566 tok/s 493 tok/s | ~18 ms ~18 ms ~18 ms | |
- | Falcon3-1B | 1B | INT4 Q8 FP16 | 599 tok/s 560 tok/s 489 tok/s | ~18 ms ~18 ms ~18 ms | |
- | Qwen2-1.5B | 1.5B | INT4 Q8 FP16 | 572 tok/s 519 tok/s 432 tok/s | ~25 ms ~25 ms ~25 ms | |
- | Qwen2.5-1.5B | 1.5B | INT4 Q8 FP16 | 572 tok/s 519 tok/s 432 tok/s | ~25 ms ~25 ms ~25 ms | |
- | Spark X2.5 1.7B | 1.7B | INT4 Q8 FP16 | 561 tok/s 505 tok/s 413 tok/s | ~28 ms ~28 ms ~28 ms | |
- | Hy-MT2 1.8B | 1.8B | INT4 Q8 FP16 | 556 tok/s 498 tok/s 404 tok/s | ~29 ms ~29 ms ~30 ms | |
- | Falcon-3B | 3B | INT4 Q8 FP16 | 516 tok/s 436 tok/s 325 tok/s | ~44 ms ~44 ms ~45 ms | |
- | CroissantLLM Base | 1.3B | INT4 Q8 FP16 | 513 tok/s 480 tok/s 413 tok/s | ~22 ms ~22 ms ~23 ms | |
- | Phi-1 | 1.3B | INT4 Q8 FP16 | 513 tok/s 480 tok/s 413 tok/s | ~22 ms ~22 ms ~23 ms | |
- | Phi-1.5 | 1.3B | INT4 Q8 FP16 | 513 tok/s 480 tok/s 413 tok/s | ~22 ms ~22 ms ~23 ms | |
- | DeepSeek-R1 3B | 3B | INT4 Q8 FP16 | 508 tok/s 431 tok/s 322 tok/s | ~44 ms ~44 ms ~45 ms | |
- | Falcon3-3B | 3B | INT4 Q8 FP16 | 506 tok/s 429 tok/s 321 tok/s | ~44 ms ~44 ms ~45 ms | |
- | Qwen2.5-3B | 3B | INT4 Q8 FP16 | 506 tok/s 429 tok/s 321 tok/s | ~44 ms ~44 ms ~45 ms | |
- | ERNIE-4.5-21B-A3B | 21B (3B active) | INT4 Q8 FP16 | 480 tok/s 412 tok/s 312 tok/s | ~53 ms ~53 ms ~54 ms | |
- | ERNIE-4.5-21B-A3B-Base | 21B (3B active) | INT4 Q8 FP16 | 480 tok/s 412 tok/s 312 tok/s | ~53 ms ~53 ms ~54 ms | |
- | ERNIE-4.5-VL-28B-A3B | 28B (3B active) | INT4 Q8 FP16 | 473 tok/s 407 tok/s 309 tok/s | ~56 ms ~56 ms ~57 ms | |
- | ERNIE-4.5-VL-28B-A3B-Base | 28B (3B active) | INT4 Q8 FP16 | 473 tok/s 407 tok/s 309 tok/s | ~56 ms ~56 ms ~57 ms | |
- | Hy-MT2 30B A3B | 30B (3B active) | INT4 Q8 FP16 | 471 tok/s 406 tok/s 308 tok/s | ~57 ms ~57 ms ~58 ms | |
- | Spark X2.5 4B | 4B | INT4 Q8 FP16 | 471 tok/s 385 tok/s 275 tok/s | ~57 ms ~57 ms ~58 ms | |
- | Phi-2 | 2.7B | INT4 Q8 FP16 | 437 tok/s 388 tok/s 305 tok/s | ~41 ms ~41 ms ~42 ms | |
- | MaLLaM-3B | 3B | INT4 Q8 FP16 | 427 tok/s 375 tok/s 290 tok/s | ~44 ms ~45 ms ~46 ms | |
- | SmolLM3 3B | 3B | INT4 Q8 FP16 | 427 tok/s 375 tok/s 290 tok/s | ~44 ms ~45 ms ~46 ms | |
- | AliceAI Foundation 80B A3B Base | 80B (3B active) | INT4 Q8 | 424 tok/s 373 tok/s | ~76 ms ~77 ms | |
- | Falcon-7B | 7B | INT4 Q8 FP16 | 399 tok/s 299 tok/s 194 tok/s | ~94 ms ~95 ms ~97 ms | |
- | Falcon3-7B | 7B | INT4 Q8 FP16 | 390 tok/s 295 tok/s 192 tok/s | ~94 ms ~95 ms ~97 ms | |
- | Hy-MT2 7B | 7B | INT4 Q8 FP16 | 390 tok/s 295 tok/s 192 tok/s | ~94 ms ~95 ms ~97 ms | |
- | Mistral-7B-v0.1 | 7.3B | INT4 Q8 FP16 | 383 tok/s 288 tok/s 186 tok/s | ~98 ms ~99 ms ~101 ms | |
- | LensVLM 9B | 9B | INT4 Q8 FP16 | 349 tok/s 255 tok/s 159 tok/s | ~120 ms ~121 ms ~123 ms | |
- | MiMo V2.6 Distill Qwen 9B | 9B | INT4 Q8 FP16 | 349 tok/s 255 tok/s 159 tok/s | ~120 ms ~121 ms ~123 ms | |
- | ChatGLM3-6B-32K | 6B | INT4 Q8 FP16 | 344 tok/s 279 tok/s 195 tok/s | ~82 ms ~83 ms ~85 ms | |
- | Yi-6B | 6B | INT4 Q8 FP16 | 344 tok/s 279 tok/s 195 tok/s | ~82 ms ~83 ms ~85 ms | |
- | Kimi-VL-A3B-Instruct | 16B (3B active) | INT4 Q8 FP16 | 333 tok/s 305 tok/s 246 tok/s | ~52 ms ~52 ms ~53 ms | |
- | Falcon3-10B | 10B | INT4 Q8 FP16 | 332 tok/s 239 tok/s 147 tok/s | ~132 ms ~134 ms ~136 ms | |
- | Falcon2-11B | 11B | INT4 Q8 FP16 | 325 tok/s 228 tok/s 138 tok/s | ~145 ms ~146 ms ~149 ms | |
- | Hunyuan Lite | 7B | INT4 Q8 FP16 | 323 tok/s 258 tok/s 175 tok/s | ~95 ms ~96 ms ~98 ms | |
- | OLMo 3 7B Base | 7B | INT4 Q8 FP16 | 323 tok/s 258 tok/s 175 tok/s | ~95 ms ~96 ms ~98 ms | |
- | SEA-LION-7B | 7.1B | INT4 Q8 FP16 | 321 tok/s 256 tok/s 174 tok/s | ~96 ms ~97 ms ~99 ms | |
- | SEA-LION-7B-Instruct | 7.1B | INT4 Q8 FP16 | 321 tok/s 256 tok/s 174 tok/s | ~96 ms ~97 ms ~99 ms | |
- | Sahabat-AI-Llama3-8B-Instruct | 8B | INT4 Q8 FP16 | 304 tok/s 239 tok/s 160 tok/s | ~108 ms ~108 ms ~111 ms | |
- | Typhoon-2-8B | 8B | INT4 Q8 FP16 | 304 tok/s 239 tok/s 160 tok/s | ~108 ms ~108 ms ~111 ms | |
- | Laguna S 2.1 | 118B (8B active) | INT4 Q8 | 303 tok/s 226 tok/s | ~157 ms ~171 ms | |
- | GLM-4-9B | 9B | INT4 Q8 FP16 | 286 tok/s 222 tok/s 146 tok/s | ~120 ms ~121 ms ~124 ms | |
- | GLM-4-9B-Chat | 9B | INT4 Q8 FP16 | 286 tok/s 222 tok/s 146 tok/s | ~120 ms ~121 ms ~124 ms | |
- | GLM-4-9B-Chat-1M | 9B | INT4 Q8 FP16 | 286 tok/s 222 tok/s 146 tok/s | ~120 ms ~121 ms ~124 ms | |
- | Yi-9B | 9B | INT4 Q8 FP16 | 286 tok/s 222 tok/s 146 tok/s | ~120 ms ~121 ms ~124 ms | |
- | Sahabat-AI-Gemma2-9B | 9.2B | INT4 Q8 FP16 | 283 tok/s 219 tok/s 144 tok/s | ~123 ms ~124 ms ~126 ms | |
- | Sahabat-AI-Gemma2-9B-Instruct | 9.2B | INT4 Q8 FP16 | 283 tok/s 219 tok/s 144 tok/s | ~123 ms ~124 ms ~126 ms | |
- | GreenMind-14B-R1 | 14B | INT4 Q8 FP16 | 223 tok/s 165 tok/s 103 tok/s | ~184 ms ~186 ms ~189 ms | |
- | Hunyuan A13B | 80B (13B active) | INT4 Q8 | 147 tok/s 124 tok/s | ~200 ms ~201 ms | |
- | Falcon-40B | 40B | INT4 Q8 FP16 | 139 tok/s 84 tok/s 45 tok/s | ~505 ms ~510 ms ~521 ms | |
- | Typhoon-2-70B | 70B | INT4 Q8 | 69 tok/s 44 tok/s | ~883 ms ~891 ms | |
- | Kimi-Dev-72B | 72B | INT4 Q8 | 67 tok/s 43 tok/s | ~908 ms ~917 ms | |
- | GLM-130B | 130B | INT4 | 39 tok/s | ~1.6s | |
不同量化精度下可运行的最大模型参数级别。
上下文长度:
4位量化
70B+ 模型
8位精度
70B 模型
16位全精度
32B 模型
本地模型训练与适配器微调支持能力。
微调上下文:
QLoRA
70B+ 模型
LoRA
70B 模型
全参数微调
7B-8B 模型
NVIDIA H200 (141GB) 上的最佳量化精度与运行规格建议。
最佳推理区间
适合在 Q4/Q8 精度下运行 70B 参数级模型并支持 32k 上下文扩展,或对中小型模型进行高并发批处理推理。
显存带宽与推理速率
具备 4800 GB/s 聚合带宽,单批次推理处于显存带宽受限模式。8B Q4 模型预估生成速度约 1067 tok/s,70B Q4 模型预估生成速度约 126 tok/s。
Assistant
在线