把完整KV cache一次前向压成“权重”,补上agent记忆在无损缓存与微调之间缺失的中间层。
The Memory Problem, Baseten | Compile 26
全片 13 分钟·真正值得盯屏约 4 分钟·3 个必看点
- 0:00 – 2:30听
记忆问题:两极之间的空档
从长程agentic场景切入:完整KV cache近乎无损但内存线性增长,微调/RAG/写markdown又压缩过狠,中间缺一个记忆层。
可靠的长程agent需要三件事:KV空间内的压缩记忆、可循环复用的记忆机制、把经验写回权重的机制。
纯口头的问题陈述与动机铺垫,无关键画面,适合当播客听。▶ 跳到 0:00 - 2:30 – 5:34略
方法版图:2x2矩阵与相关工作定位
用“选择vs合成”ד按上下文vs摊销”的矩阵给KV cache压缩方法分类,并把cartridges(按上下文合成)、DeepSeek稀疏注意力(预训练阶段)与本方法(摊销+合成)放进各自象限。
本方法落在“摊销+合成”象限:把优化成本预付到训练阶段,推理时一次前向即可压缩。
核心信息在2x2矩阵幻灯片上(157s、206s两个视觉时刻),扫一眼图即可抓住分类框架,讲解可加速听。▶ 跳到 2:30 - 5:38 – 7:40略
压缩器架构:摊销思想与交叉注意力
借鉴稀疏自编码器的摊销思路,训练一个黑盒压缩器;因KV cache变长,用少量固定query对每个token(K、V拼接后经学习投影)做交叉注意力得到压缩表示。
不在推理时对每个上下文跑昂贵优化,而是学一个一次前向就能完成KV cache压缩的函数。
384s处有架构示意幻灯片,看图理解交叉注意力的数据流比纯听更快,其余讲解可略读。▶ 跳到 5:38 - 7:40 – 8:58听
训练细节:恒等初始化与KL蒸馏
两个关键训练决定:输出投影初始化为恒等映射,让训练从不破坏信息的注意力加权混合起步;目标函数是完整与压缩KV cache条件下输出分布的KL蒸馏。
KL蒸馏损失迫使模型在压缩前后行为一致——压缩的评判标准是“模型说的话变没变”。
此段是口头展开的训练细节,无独立视觉时刻,两个要点靠听即可完整获取。▶ 跳到 7:40 - 9:01 – 10:55看
迭代压缩为何崩溃、如何救
朴素的“压缩→生成新块→再压缩”循环在单次压缩目标下几轮就崩溃;解法是跳过紧邻块、在其后的后续块上对完整与压缩上下文算KL散度。
跳块KL这一个技巧让16甚至32轮迭代压缩仍保持较高精度,是长程可用性的关键。
555s与602s两个视觉时刻集中在此:崩溃现象与跳块方案的对比图是理解该技巧的最直接证据,值得盯着画面看。▶ 跳到 9:01 - 10:55 – 12:15看
洞见:压缩就是在构造权重
指出压缩后的KV cache在结构上就是一个MLP——query乘keys是上投影、softmax是非线性、乘values是下投影,因此压缩过程等于从上下文直接构造权重。
这是不同于梯度下降的第二种产生权重的机制,有望把上下文学习“见一次就会”的样本效率带入持久知识。
672s的结构对应推导需要跟着画面逐项对照才能真正看懂,是全片概念密度最高的一段。▶ 跳到 10:55 - 12:15 – 13:12听
展望:压缩与梯度下降的结合
收尾提出未来方向:在同一权重块上先用压缩构造权重、再继续梯度下降,实现样本高效的持续学习。
记忆的终局是两种权重生成机制协同:压缩负责快速吸收,梯度下降负责长期固化。
口头展望与总结,无新画面,适合听完收束全片脉络。▶ 跳到 12:15