第 12 章 · 约 22 分钟
端边云协同
结合传输与交互,任务该放在端、边还是云?
阅读中·实验未完成·考核未交
位置
模型时间不是交互时间
用户感知的是按下发送到听到回答。里面有采集、上行、排队、prefill、decode、下行、播放。云端 H100 上 8 ms 的一步,叠上 80 ms RTT 和一次工具往返,产品已经换了一种感觉。
端侧先看容量。Qwen3-8B 的 BF16 权重 16.38 GB,多数手机直接出局;q4 量化后才进入旗舰内存的讨论。即便放得下,LPDDR 带宽大约 85 GB/s,单请求 8K decode 读 16.3 GB 就要约 190 ms,远慢于桌面 GPU。
| 设备 | 带宽量级 | 16.3 GB 读取下界 |
|---|---|---|
| 手机 LPDDR5X ×4 | 约 85 GB/s | 约 190 ms |
| M 系列统一内存 | 数百 GB/s | 数十 ms |
| H100 HBM | 3.35 TB/s | 约 5 ms(含 KV) |
拆分要付广域税
端侧做 prefill、云侧做 decode,或反过来,都要运 KV 或隐藏状态。Wi-Fi 和蜂窝的带宽、丢包、切换会把“谁必须等它”变成不稳定的随机量。无线变化下,重传和重建 KV 往往比继续用一份可能已过期的状态更安全。
LoRA 让端侧微调变得可能:冻结 16.4 GB 基模,只为很小的 adapter 保留优化器状态。一张 4090 训练不了全参数 8B,却训练得了它的 rank-16 adapter。位置选择因此不只是推理,也包括谁来更新哪一部分。
实验
端边云放置
容量不够,先量化或不要把完整权重放在这台设备。
本地一步
192.75 ms
加一次 RTT
232.75 ms
考核
第 12 章考核
3 题
1.云端 decode 8 ms,RTT 80 ms(一来一回各 40 ms 已含在内)。用户还要等什么?
2.为什么多数手机跑不了 BF16 Qwen3-8B?
3.端云之间做 TP=2,36 层每层两次归约。这为什么通常不划算?
全部作答后交卷。