趋近智
NVIDIA Blackwell B300 (288GB) 配备 288 GB 专用显存与 8000 GB/s 显存带宽,支持 CUDA 和 TensorRT-LLM 运行环境,可进行全精度与量化大模型推理。
总显存
288 GB
可用显存上限
288 GB
显存带宽
8000 GB/s
最大推理模型级别
70B+ 模型 (Q4)
热设计功耗
1000W
随上下文长度增长的显存需求评估。当曲线超过参考线时将导致显存不足(OOM)。
量化精度:
主流开源大模型在 NVIDIA Blackwell B300 (288GB) 上的推理速度、显存兼容性与生成吞吐表现。
排序:
上下文长度:
KV 缓存:
显卡数量:
不同量化精度下可运行的最大模型参数级别。
上下文长度:
4位量化
70B+ 模型
8位精度
70B 模型
16位全精度
70B 模型
本地模型训练与适配器微调支持能力。
微调上下文:
QLoRA
70B+ 模型
LoRA
70B 模型
全参数微调
7B-8B 模型
NVIDIA Blackwell B300 (288GB) 上的最佳量化精度与运行规格建议。
最佳推理区间
适合在 Q4/Q8 精度下运行 70B 参数级模型并支持 32k 上下文扩展,或对中小型模型进行高并发批处理推理。
显存带宽与推理速率
具备 8000 GB/s 聚合带宽,单批次推理处于显存带宽受限模式。8B Q4 模型预估生成速度约 1778 tok/s,70B Q4 模型预估生成速度约 211 tok/s。
Assistant
在线