跳到内容

2 章实验

KV 缓存

计算、参数和上下文状态,如何变成 M、F、R?

实验

KV 缓存

每 token

147 KB

全部 KV

1.21 GB

权重+工作区后剩余

60.41 GB

还能再塞几条

50

Qwen3-8B 默认是 144 KiB/token。把 n_KV 从 8 拖到 32,就是从 GQA 回到 MHA。

返回这一章