跳到内容

12 章 · 约 22 分钟

端边云协同

结合传输与交互,任务该放在端、边还是云?

阅读中·实验未完成·考核未交

位置

模型时间不是交互时间

用户感知的是按下发送到听到回答。里面有采集、上行、排队、prefill、decode、下行、播放。云端 H100 上 8 ms 的一步,叠上 80 ms RTT 和一次工具往返,产品已经换了一种感觉。

端侧先看容量。Qwen3-8B 的 BF16 权重 16.38 GB,多数手机直接出局;q4 量化后才进入旗舰内存的讨论。即便放得下,LPDDR 带宽大约 85 GB/s,单请求 8K decode 读 16.3 GB 就要约 190 ms,远慢于桌面 GPU。

同一条 decode 一步,设备不同
设备带宽量级16.3 GB 读取下界
手机 LPDDR5X ×4约 85 GB/s约 190 ms
M 系列统一内存数百 GB/s数十 ms
H100 HBM3.35 TB/s约 5 ms(含 KV)

拆分要付广域税

端侧做 prefill、云侧做 decode,或反过来,都要运 KV 或隐藏状态。Wi-Fi 和蜂窝的带宽、丢包、切换会把“谁必须等它”变成不稳定的随机量。无线变化下,重传和重建 KV 往往比继续用一份可能已过期的状态更安全。

LoRA 让端侧微调变得可能:冻结 16.4 GB 基模,只为很小的 adapter 保留优化器状态。一张 4090 训练不了全参数 8B,却训练得了它的 rank-16 adapter。位置选择因此不只是推理,也包括谁来更新哪一部分。

实验

端边云放置

容量不够,先量化或不要把完整权重放在这台设备。

本地一步

192.75 ms

加一次 RTT

232.75 ms

考核

第 12 章考核

3 题

  1. 1.云端 decode 8 ms,RTT 80 ms(一来一回各 40 ms 已含在内)。用户还要等什么?

  2. 2.为什么多数手机跑不了 BF16 Qwen3-8B?

  3. 3.端云之间做 TP=2,36 层每层两次归约。这为什么通常不划算?

全部作答后交卷。