结业
十五问
不考名词堆砌。每题都在问:这个方案有没有漏掉容量、带宽、通信或串行依赖。
题目
考核
结业考核
15 题
1.时间下界 T_lower = max(F/Π, R/β) 的前提是?
2.容量检查应写成?
3.Qwen3-8B 的 c_KV = 144 KiB。8192 token 是多少 GiB?
4.GQA 相对 MHA,在 Qwen3-8B 上把 KV 变成原来的?
5.单请求 decode 的算术强度大约 2 FLOP/byte。H100 脊点约 295 FLOP/byte。结论?
6.70B 8-bit 约 73.73 GB 放进 80 GB H100 后还剩约 6 GB。能否再接一条 8K、2.68 GB KV 的 70B 请求?
7.PagedAttention 和 FlashAttention 的分工?
8.PD 分离交接 1.125 GiB KV,经池中转相对直传?
9.朴素数据并行 64 卡训练 Qwen3-8B,状态复制总量约?
10.Amdahl:工具等待占 70%,模型加速到瞬时。最大整体加速?
11.为什么 decode 的张量并行不适合跨公网?
12.训练期限分析漏掉故障恢复,会发生什么?
13.400 Gbit/s = ?
14.MoE 总参数 35B、每 token 激活 3B。一步 decode 的矩阵工作更接近?
15.本课最核心的设计口诀是?
全部作答后交卷。