术语
速查
先记住这些量和公式,再回头看章节。数字会变,关系不变。
名词与公式
M / F / R / T
容量、运算量、读写量、时间。T_lower = max(F/Π, R/β),且 M ≤ Mcap。
MFU / MBU
模型 FLOPs 利用率 F/(ΠT) 与带宽利用率 R/(βT)。回答离物理极限还有多远。
Prefill / Decode
预填充一次处理已知输入;解码逐步生成新 token,复用 KV。
KV cache
已处理 token 的键与值。c_KV = 2·L·n_KV·d_h·b。用存储换回重算。
GQA / MQA / MLA
分组、多查询、低秩潜空间三种减少 KV 的注意力变体。
Roofline
算术强度 I=F/R 与脊点 I*=Π/β 比较,判断算力墙还是带宽墙。
Amdahl
Speedup = 1/((1−f)+f/s)。剩余串行部分规定加速上限。
PagedAttention
把 KV 分页映射到物理块,降低预留碎片,提高并发。
FlashAttention
在算子内分块并做在线 softmax,减少 HBM 上的中间结果。
TP / PP / DP / EP
张量、流水线、数据、专家并行。切的维度不同,通信形态不同。
ZeRO
按阶段分片优化器、梯度、参数,用通信换复制的容量。
PD 分离
Prefill 与 Decode 分池。收益来自独立批处理,成本是 KV 交接。
超节点
通过高带宽互联紧密协作的一组加速器,scale-up 域。
Scale-up / Scale-out
柜内高带宽协作 vs 跨节点网络扩展。
TTFT / TPOT
首 token 时间与每输出 token 间隔。吞吐不能代替它们。