0%
第 2 章实验
计算、参数和上下文状态,如何变成 M、F、R?
实验
每 token
147 KB
全部 KV
1.21 GB
权重+工作区后剩余
60.41 GB
还能再塞几条
50
Qwen3-8B 默认是 144 KiB/token。把 n_KV 从 8 拖到 32,就是从 GQA 回到 MHA。