第 10 章 · 约 26 分钟
训练系统
如何安排状态、通信与恢复,在期限内取得有效进展?
阅读中·实验未完成·考核未交
期限
能推理,不代表能训练
Qwen3-8B 的推理权重约 16.4 GB,混合精度 Adam 的常驻训练状态约 131 GB。激活还要在前向和反向之间活着。训练系统设计,就是用分片、重计算和卸载,把这份状态塞进机器,并在截止日期前跑完规定的 token。
DP
Z1
Z2
Z3
M0=16N M1=4N+12N/d M2=2N+14N/d M3=16N/d
d 是数据并行组大小。ZeRO-3 把权也切开,执行前要 AllGather。空间换的是通信。
重计算、气泡、检查点
激活检查点丢掉部分前向结果,反向时重算。省的是 M,加的是 F。显存刚好差一点时,它往往比再加一组卡更便宜。流水线气泡是另一种税:zero-bubble 调度把权重梯度从关键路径上拿开,让输入梯度先走。
检查点决定故障后从哪一步续跑。Qwen3-8B 一次迭代结束的 checkpoint 约 115 GB。保存太勤,吞吐被 IO 吃掉;太疏,故障窗口里的有效算力作废。期限分析要把故障率算进去,而不是假设永不宕机。
实验
ZeRO 分片
每卡常驻
16.38 GB
相对 DP
13%
激活和工作区另计。ZeRO-3 执行前要 AllGather 当前模块的权重。
考核
第 10 章考核
3 题
1.八卡 ZeRO-3,Qwen3-8B 每卡常驻大约?
2.显存差 3 GB,重计算激活和再加卡,首先该比什么?
3.ZeRO-3 每步要多次集合通信。为什么链路时间不等于通信等待?
全部作答后交卷。