第 7 章 · 约 22 分钟
数据中心网络
数据跨加速器传输时,交接、拥塞和故障如何拖住计算?
阅读中·实验未完成·考核未交
scale-out
超节点之外,字节要走另一套物理
超节点内部是 scale-up:低延迟、高带宽、拓扑固定。多个超节点之间是 scale-out:网卡、交换、拥塞控制和故障域。400 Gbit/s 的网卡线速是 50 GB/s,传 1 GB 理想只要 20 ms;启动、协议头、共享链路和其他流量会把这个数字拉长。
三种流量不应混为一谈。服务入口传的是请求文本;共享存储传的是模型文件,可以提前加载;加速器互联传的是当前层必须立刻到达的中间结果。最后一种流量的依赖最硬:下一层在等它。
T_net ≈ T_start + n · RTT + bytes / B_eff
大块看带宽,小消息、多往返看延迟。在途数据量 ≈ B × RTT,窗口不够就会填不满链路。
RDMA 把 CPU 移出关键路径,但没有取消等待
直接内存访问让网卡把数据写入指定内存,CPU 只负责发起和管理。这减少了主机参与次数,并不减少光速和交换机排队。顺序与匹配仍然要有人做:消息乱序到达时,计算不能假装数据已经齐了。
拥塞会让有效带宽掉到标称值的一个零头。训练的周期通信(AllReduce)特别怕这种抖动:一个掉队的 rank 卡住整步。故障恢复则把“谁必须等它”变成检查点间隔与重算窗口的设计问题。
实验
网络往返
时间
27.50 ms
把字节拖到 8 KiB、次数拖到 72,就是跨节点 TP。把字节拖到 1.125 GiB、次数 1,就是 PD 直传。
考核
第 7 章考核
3 题
1.400 Gbit/s 网卡,传 1 GB 的理想时间?
2.为什么小消息的集合通信容易被延迟而不是带宽卡住?
3.P→池→D 中转 KV,相对于 P→D 直传,逻辑搬移次数?
全部作答后交卷。