在配置算力之前,
精确建模 LLM 显存、吞吐量与延迟。
基于真实硬件基准精度,模拟动态 KV 缓存增长、互联瓶颈与并发延迟突增极限。
并发负载下的 TTFT
P50 TTFT
P95 TTFT
Llama-3-70B FP8 · 2x H100 · 32k 上下文
运行工作点
4 用户 · 约 4.1s TTFT
安全并发拐点
约 6 用户
显存不足
>8 用户
开源模型是免费的,但 GPU 算力不是。
拉取容器
→
CUDA 匹配的 wheels
→
下载 140 GB 权重
→
显存溢出 (OOM)
权重装得下,KV 缓存装不下。
在生产级上下文长度与并发下,KV 缓存线性增长并耗尽显存。显存溢出 (OOM) 往往在权重加载完成、实际流量涌入后才会发生。
单并发基准测试看起来不错。
在并发压力下,每位用户的每秒 Token 数仅为单并发测试的一小部分。当批次容量达到饱和时,排队延迟将占据主导地位。
两张 GPU 本应是两倍速度。
缺乏 NVLink 时,卡间通信开销占据主导。张量并行执行因等待 PCIe 总线带宽而严重停顿。
账单到来前,先算一笔账。
告别反复试错的集群选型。精确计算显存容纳上限、预估每小时成本、评估并发极限,并验证增加 GPU 究竟能提升吞吐量还是仅仅增加通信开销。
显存占用细分
· Llama-3-70B FP8 · 32,768 上下文 · 4 并发用户
模型权重: 70.5 GB
活跃 KV: 21.5 GB
可用显存池: 68.0 GB
44.1%
13.4%
42.5%
活跃显存
92.0 GB
占 2x H100 160 GB 显存的 57.5%
并发上限
15 位并发用户
含 68.0 GB 动态缓冲空间
首字延迟 (TTFT)
~3.75s
p50: 3.75s · p95: 3.84s
估算吞吐量
约 39 tok/s/用户
集群聚合吞吐量 156 tok/s
在规划集群规模前,值得校验的测试结果。
总吞吐量饱和,而用户单流速度持续下降。
超过饱和批次后,总吞吐量基本持平,而单用户延迟激增。交叉点决定了最佳的部署决策。
INT4 量化将吞吐量饱和的批次大小缩减至四分之一,从而提升了服务容量。 验证 →
权重低比特量化对 KV 缓存毫无帮助。
INT4 仅压缩模型静态权重,KV 缓存默认仍未压缩。在 32k 或 128k 上下文长度下,KV 缓存显存占用会迅速超过权重本身。
KV 缓存量化可降低单用户显存占用,从而支持更大的并发批次大小。 验证 →
更多 GPU 并不意味着更快速度。互连限制扩展。
跨 PCIe 总线扩展张量并行会引入 All-Reduce 通信延迟,甚至可能抵消新增的算力增益。
对比张量并行部署中 NVLink 与 PCIe 的吞吐量扩展曲线。 验证 →
基于物理硬件基准测试进行验证。
预测数据通过覆盖不同硬件架构、量化格式与并发层级的物理基准测试回归套件进行验证。我们透明跟踪并公布所有实测偏差。
在开通 8 卡或 16 卡 GPU 节点之前,先校验精确数据。
广泛应用于全球领先科技公司与高校的科研人员及工程师



数据背后的模型架构规格。
开源模型的结构化参数:注意力机制、隐藏层维度、层数与头数、上下文窗口,以及各量化格式下的硬件需求。
精选课程
包含构建大语言模型的 30 章大师课,以及涵盖 Transformer 架构、注意力机制、权重低比特量化和推理系统的工程课程。
通过系列课程深入探索大模型底层架构与运行机制。
需要流水线并行、多节点拓扑或生产流量仿真?
最新分析
Sep 8, 2026
Understand how Claude Desktop and Claude Code tool search filtering works
Aug 17, 2026
The exact formulas and techniques to calculate VRAM requirements and predict throughput for massive language models, avoiding costly out-of-memory errors during deployment.
olve ChatGPT action discovery probe errors by handling POST discovery probes with valid JSON-RPC fallback responses



