ApX 标志ApX 标志

趋近智

在配置算力之前,
精确建模 LLM 显存、吞吐量与延迟。

基于真实硬件基准精度,模拟动态 KV 缓存增长、互联瓶颈与并发延迟突增极限。

并发负载下的 TTFT

P50 TTFT

P95 TTFT

Llama-3-70B FP8 · 2x H100 · 32k 上下文

运行工作点

4 用户 · 约 4.1s TTFT

安全并发拐点

约 6 用户

显存不足

>8 用户

开源模型是免费的,但 GPU 算力不是。

拉取容器

→

CUDA 匹配的 wheels

→

下载 140 GB 权重

→

显存溢出 (OOM)

权重装得下,KV 缓存装不下。

在生产级上下文长度与并发下,KV 缓存线性增长并耗尽显存。显存溢出 (OOM) 往往在权重加载完成、实际流量涌入后才会发生。

单并发基准测试看起来不错。

在并发压力下,每位用户的每秒 Token 数仅为单并发测试的一小部分。当批次容量达到饱和时,排队延迟将占据主导地位。

两张 GPU 本应是两倍速度。

缺乏 NVLink 时,卡间通信开销占据主导。张量并行执行因等待 PCIe 总线带宽而严重停顿。

无需反复试错。在部署配置之前,即可对每一处系统瓶颈进行数学建模。

账单到来前,先算一笔账。

告别反复试错的集群选型。精确计算显存容纳上限、预估每小时成本、评估并发极限,并验证增加 GPU 究竟能提升吞吐量还是仅仅增加通信开销。

显存占用细分

· Llama-3-70B FP8 · 32,768 上下文 · 4 并发用户

模型权重: 70.5 GB

活跃 KV: 21.5 GB

可用显存池: 68.0 GB

44.1%

13.4%

42.5%

活跃显存

92.0 GB

占 2x H100 160 GB 显存的 57.5%

并发上限

15 位并发用户

含 68.0 GB 动态缓冲空间

首字延迟 (TTFT)

~3.75s

p50: 3.75s · p95: 3.84s

估算吞吐量

约 39 tok/s/用户

集群聚合吞吐量 156 tok/s

在规划集群规模前,值得校验的测试结果。

总吞吐量饱和,而用户单流速度持续下降。

超过饱和批次后,总吞吐量基本持平,而单用户延迟激增。交叉点决定了最佳的部署决策。

INT4 量化将吞吐量饱和的批次大小缩减至四分之一,从而提升了服务容量。 验证 →

权重低比特量化对 KV 缓存毫无帮助。

INT4 仅压缩模型静态权重,KV 缓存默认仍未压缩。在 32k 或 128k 上下文长度下,KV 缓存显存占用会迅速超过权重本身。

KV 缓存量化可降低单用户显存占用,从而支持更大的并发批次大小。 验证 →

更多 GPU 并不意味着更快速度。互连限制扩展。

跨 PCIe 总线扩展张量并行会引入 All-Reduce 通信延迟,甚至可能抵消新增的算力增益。

对比张量并行部署中 NVLink 与 PCIe 的吞吐量扩展曲线。 验证 →

基于物理硬件基准测试进行验证。

预测数据通过覆盖不同硬件架构、量化格式与并发层级的物理基准测试回归套件进行验证。我们透明跟踪并公布所有实测偏差。

在开通 8 卡或 16 卡 GPU 节点之前,先校验精确数据。

广泛应用于全球领先科技公司与高校的科研人员及工程师

Stanford University
Massachusetts Institute of Technology
Oxford University
Tsinghua University
Peking University
Carnegie Mellon University
Nvidia
Google Cloud
Amazon Web Services
Alibaba
Huawei
Bytedance

数据背后的模型架构规格。

开源模型的结构化参数:注意力机制、隐藏层维度、层数与头数、上下文窗口,以及各量化格式下的硬件需求。

模型参数量 (总/激活)注意力机制上下文长度INT4 下显存占用运行硬件
Llama-3-70B70.6BGQA8,19239.2 GB2x 24GB
Mistral-8x7B46.7B (12.9B)GQA32,76825.3 GB1x 32GB
Qwen-2.5-72B72.7BGQA131,07241.2 GB2x 24GB
Llama-3-8B8.0BGQA8,1925.7 GB1x 16GB
探索模型目录 →

精选课程

包含构建大语言模型的 30 章大师课,以及涵盖 Transformer 架构、注意力机制、权重低比特量化和推理系统的工程课程。

通过系列课程深入探索大模型底层架构与运行机制。

如何构建大语言模型
大型语言模型
专员级
大师课

如何构建大语言模型

掌握构建、训练和优化复杂大语言模型的工程技能。

Transformer模型入门
机器学习
专业级

Transformer模型入门

掌握Transformer模型的核心构架和注意力机制,它们在顶尖自然语言处理应用中的应用。

查看课程
大语言模型实用量化技术
大型语言模型
专业级

大语言模型实用量化技术

实现大语言模型量化技术(PTQ、QAT、GPTQ、GGUF),以减小模型体积并提升推理速度。

查看课程
量化大型语言模型的高效部署与推理
机器学习
专员级

量化大型语言模型的高效部署与推理

通过掌握高阶技术与工具集,在各类硬件上高效部署量化大型语言模型。

查看课程

需要流水线并行、多节点拓扑或生产流量仿真?

最新分析

Understand how Claude Desktop and Claude Code tool search filtering works

The exact formulas and techniques to calculate VRAM requirements and predict throughput for massive language models, avoiding costly out-of-memory errors during deployment.

olve ChatGPT action discovery probe errors by handling POST discovery probes with valid JSON-RPC fallback responses