给定 GPU 算力,一个模型到底能扛多少 QPS?TTFT / TPOT / P95 怎么算?
中文圈讲 LLM 推理的内容,两头多、中间空:一头是“什么是 KV Cache”的入门科普,一头是 vLLM 源码逐行解析;而正中间这层——给你 N 张卡,这套服务到底能接多少流量?P95 延迟敢不敢写进合同?要买多少台机器、花多少钱?——系统的、能照着算出答案的手册,迄今少见。
这本手册补的就是这一层:容量规划(Capacity Planning)。它不是推理技巧合集,也不是论文综述,而是一套闭环的实战体系——每个公式都配完整代入算例,每个方法都落到可直接照抄的 SOP,每个常数都追问“从哪来、误差多大、怎么测准”。从单机三面墙到排队论 P95,从开环压测到 500 万 DAU 的采购决策,一条链路打通。
它不教你训练模型,也不教你调 kernel——它回答的是每个要做推理落地的人都绕不开、却一直在拍脑袋的问题。
行业里大多数容量方案是错的,错法惊人地一致:
- 拿闭环压测(并发打满)的吞吐当容量——它隐含 ρ=100%,而 ρ=100% 时排队等待趋于无穷;
- 拿 Decode 吞吐 ÷ 输出长度 估 QPS——假装 Prefill 免费,2048/512 负载下高估 ~4 倍;
- 裸套公式不锚定——效率常数(MFU/MBU)差 30% 到 10 倍,结论差出一倍预算。
本手册把容量规划拆成三层模型,每层一套可算的公式:
| 层 | 回答的问题 | 核心工具 |
|---|---|---|
| 物理层 | 理论上限多少? | Roofline:Prefill 看算力,Decode 看带宽,并发看显存(KV Cache) |
| 系统层 | 单节点实际能服务多少(λ_sat)? | 三面墙取最小:算力墙 / TPOT-SLA 墙 / KV 槽位墙 |
| 排队层 | 真实流量下 P50/P95 多少? | 排队论:E[W] ∝ ρ/(1−ρ),P95 在 ρ→1 时双曲线爆炸 |
贯穿全书的三条纪律:测出瓶颈在哪一层(不猜);用富余资源换瓶颈资源(方向反了就是负优化);动手前算阿姆达尔账(幅度 × 占比)。所有效率常数必须锚定——用实测数据把公式常数钉死,裸用经验值误差 30% 起步。
- 推理平台 / SRE / 容量规划工程师:三面墙、排队模型、开环压测 SOP 可直接照抄;
- 技术管理者(CTO/架构师):第 0 章一页纸 + 第 7 章成本换算与自建 vs 云,够支撑采购决策;
- 售前 / 交付:要当着客户的面算"你的生意要几台机器",第 7 章的七步流程和逐行推演是模板;
- 性能/仿真方向研究者:第 5 章系统梳理了 Vidur、AIConfigurator、LLMServingSim 等五条仿真路线及各自的误差边界。
不适合:想找 CUDA/算子级调优技巧的读者(本手册明确不做引擎调优);想找现成常数表照抄的读者(本手册只给区间和方法,常数必须自己锚定)。
| 章 | 内容 | 你会得到什么 |
|---|---|---|
| 0. 速览与总纲 | 术语人话表、一页纸结论、三条纪律、符号公式速查卡 | 10 分钟建立全书地图;忘了公式回这章查 |
| 1. 三层结构 | 饭店模型:为什么 70% 才是真实容量 | 识别三种典型错误方案 |
| 2. 物理层 | Prefill/Decode 瓶颈、Roofline、KV Cache、吞吐三个口径 | 会算任何"模型 × 卡"的理论上限 |
| 3. 系统层 | 三面墙取 min、吞吐-延迟咬尾的闭式解、两个完整算例(72B×H100 / 32B×H20)、负载画像、前缀缓存与 P/D 分离修正 | 会算单节点 λ_sat,并知道每个数字从哪来 |
| 4. 排队层 | 排队论三分钟扫盲、M/M/c 与 Allen–Cunneen、ρ~P95 对照表、峰值系数、LLM 特有的六个排队效应、100 请求突发的微观走查 | 会从"物理上限"推到"真实体验" |
| 5. 仿真方法 | 五条仿真路线谱系(纯 Roofline → Cycle 级)、Vidur/AIConfigurator/LLMServingSim 解剖、误差来源五层、选型决策树 | 看任何仿真报告能说出误差藏在哪一层 |
| 6. 压测实战 | 三种压测形态十秒判定、协同遗漏、客户端 vs 服务端参数、开环 SOP、多轮对话压测、λ* 与 μ 两口径、Trace 回放 | 会设计压测、会拆穿别人的压测报告 |
| 7. 端到端算例 | 从零规划 vs 存量纠偏、500 万 DAU 客服完整算例(249 台逐行推演)、P/D 分离对照(为什么反而费卡)、成本换算、自建 vs 云回本点、混合负载分配 | 会独立完成一次完整容量规划并交付报告 |
| 8. 进阶专题 | 投机解码(为什么大 batch 失效)、多模型路由、冷启动、多模态输入、非 Transformer 边界 | 知道"省卡大招"什么时候是负优化 |
| 9. 集群与基础设施 | TP/PP/DP 分工、五种网络通信量、拓扑与扩展效率、存储与冷启动介质、国产卡部署 MoE(EP 通信与 MLA) | 会做节点以上的集群级决策 |
- 只有 10 分钟:第 0 章(一页纸 + 三条纪律);
- 做采购/汇报决策:第 0 章 → 第 7 章;
- 第一次做容量规划:顺序通读,边读边用第 7 章算例练手;
- 压测前夜:直接第 6 章,SOP 可照抄;
- 评审别人的方案:第 1 章三种错误 + 6.2 十秒判定流程。
本仓库为《大模型推理案头手册》(v8.0)的开源节选。完整版中的「常数的来源、误差与锚定」(原第 5 章)、MoE 完整算例(原 3.5 / 8.4 节)、规划报告模板、误区清单与附录未包含在本版中。正文反复强调的"锚定"纪律完整保留——本版给你方法框架和公式,常数的实测方法属于完整版内容。文中 L1/L2/L3/L4 为常数可信度分级:L1 实测锚定 > L2 仿真校准 > L3 公开基准 > L4 经验值。
完整版在开源版基础上增加了真正的“干货”部分:
- 常数档案卡与锚定操作:MFU/MBU 实测锚定四步、误差预算表、效率常数获取四层级;
- 实测锚定数据:DeepSeek-R1 × H20、国产 64 卡 PD 分离集群等真实集群的锚定常数与回测案例;
- MoE 完整算例:MoE 三面墙逐步走查、负载形态敏感性、EP 通信税的定量分析;
- 工具与模板:给领导的规划报告模板、误区清单 Top 19、附录速查表(GPU 参数 / KV Cache / vLLM & SGLang 参数)。
需要完整版、详细数据,或容量规划咨询与合作,请联系作者:yanwang_neu@126.com
内容纠错、讨论与建议请走 Issues,公开讨论大家都能受益。
本作品采用 CC BY-NC-SA 4.0 许可:可自由转载、改编,须署名、非商业使用、相同方式共享。