实验
十二个实验
每章一个计算器。改模型、卡、batch 或链路,看时间下限钉在带宽、算力还是通信上。
按章节
第 1 章
单步下限
如何用几个关键数字,估算一次模型执行?
未完成
第 2 章
KV 缓存
计算、参数和上下文状态,如何变成 M、F、R?
未完成
第 3 章
Prefill / Decode
请求怎样到来,资源需求与等待如何被改写?
未完成
第 4 章
屋顶线
芯片的计算、存储和数据通路,怎样变成服务能力?
未完成
第 5 章
算子融合
如何组织执行,少搬、少提交、少等待?
未完成
第 6 章
并行切分
模型如何在多卡之间分工,协作该有多大?
未完成
第 7 章
网络往返
数据跨加速器传输时,交接、拥塞和故障如何拖住计算?
未完成
第 8 章
连续批处理
如何安排批处理、请求和缓存,提高给定加速器的服务效率?
未完成
第 9 章
PD 分离
计算与状态放在哪里,如何分工、共享和扩缩?
未完成
第 10 章
ZeRO 分片
如何安排状态、通信与恢复,在期限内取得有效进展?
未完成
第 11 章
任务链
如何把模型、工具和共享资源组织成完整任务?
未完成
第 12 章
端边云放置
结合传输与交互,任务该放在端、边还是云?
未完成