AI 学习
从逐词生成理解 KV Cache
不从公式开始,而是从模型下一次到底重复算了什么开始。
理解 KV Cache 最直观的方式,是先看自回归生成里那些被重复计算的部分。
Prefill 与 Decode
Prefill 一次处理完整提示词,Decode 则每次只生成一个新 token。
正在绘制图表…
缓存的是什么
过去 token 对应的 Key 和 Value 不会因为新 token 到来而变化,所以可以保存下来,只计算新位置的投影。
空间换时间
缓存减少计算,却增加显存占用。批量、序列长度与层数共同决定了这笔开销。
来自开放网络的回应
引用、喜欢、转发和站外回复会通过 Webmention 回到这里。
接收与展示代码已经就绪,注册正式域名后即可开始收集回应。
评论
评论接入已准备好,补充 GitHub Discussions 配置后即可开放。
需要一个公开 GitHub 仓库,并为它启用 Discussions、安装 Giscus App、选择评论分类。