从逐词生成理解 KV Cache 永久链接
近距离拍摄的电子电路板

AI 学习

从逐词生成理解 KV Cache

不从公式开始,而是从模型下一次到底重复算了什么开始。

理解 KV Cache 最直观的方式,是先看自回归生成里那些被重复计算的部分。

Prefill 与 Decode

Prefill 一次处理完整提示词,Decode 则每次只生成一个新 token。

Mermaid
正在绘制图表…

缓存的是什么

过去 token 对应的 Key 和 Value 不会因为新 token 到来而变化,所以可以保存下来,只计算新位置的投影。

空间换时间

缓存减少计算,却增加显存占用。批量、序列长度与层数共同决定了这笔开销。

KV memory2×L×H×T\text{KV memory} \propto 2 \times L \times H \times T

来自开放网络的回应

引用、喜欢、转发和站外回复会通过 Webmention 回到这里。

接收与展示代码已经就绪,注册正式域名后即可开始收集回应。

评论

评论接入已准备好,补充 GitHub Discussions 配置后即可开放。

需要一个公开 GitHub 仓库,并为它启用 Discussions、安装 Giscus App、选择评论分类。