EN
Cursor Compile

把完整KV cache一次前向压成“权重”,补上agent记忆在无损缓存与微调之间缺失的中间层。

The Memory Problem, Baseten | Compile 26

13 min
AgentContext

全片 13 分钟·真正值得盯屏约 4 分钟·3 个必看点

橙色 = 推荐必看的 4 分钟其余读导览就够
逐段导览 · 7 段
  1. 0:00 2:30

    记忆问题:两极之间的空档

    从长程agentic场景切入:完整KV cache近乎无损但内存线性增长,微调/RAG/写markdown又压缩过狠,中间缺一个记忆层。

    可靠的长程agent需要三件事:KV空间内的压缩记忆、可循环复用的记忆机制、把经验写回权重的机制。

    纯口头的问题陈述与动机铺垫,无关键画面,适合当播客听。▶ 跳到 0:00
  2. 2:30 5:34

    方法版图:2x2矩阵与相关工作定位

    用“选择vs合成”ד按上下文vs摊销”的矩阵给KV cache压缩方法分类,并把cartridges(按上下文合成)、DeepSeek稀疏注意力(预训练阶段)与本方法(摊销+合成)放进各自象限。

    本方法落在“摊销+合成”象限:把优化成本预付到训练阶段,推理时一次前向即可压缩。

    核心信息在2x2矩阵幻灯片上(157s、206s两个视觉时刻),扫一眼图即可抓住分类框架,讲解可加速听。▶ 跳到 2:30
  3. 5:38 7:40

    压缩器架构:摊销思想与交叉注意力

    借鉴稀疏自编码器的摊销思路,训练一个黑盒压缩器;因KV cache变长,用少量固定query对每个token(K、V拼接后经学习投影)做交叉注意力得到压缩表示。

    不在推理时对每个上下文跑昂贵优化,而是学一个一次前向就能完成KV cache压缩的函数。

    384s处有架构示意幻灯片,看图理解交叉注意力的数据流比纯听更快,其余讲解可略读。▶ 跳到 5:38
  4. 7:40 8:58

    训练细节:恒等初始化与KL蒸馏

    两个关键训练决定:输出投影初始化为恒等映射,让训练从不破坏信息的注意力加权混合起步;目标函数是完整与压缩KV cache条件下输出分布的KL蒸馏。

    KL蒸馏损失迫使模型在压缩前后行为一致——压缩的评判标准是“模型说的话变没变”。

    此段是口头展开的训练细节,无独立视觉时刻,两个要点靠听即可完整获取。▶ 跳到 7:40
  5. 9:01 10:55

    迭代压缩为何崩溃、如何救

    朴素的“压缩→生成新块→再压缩”循环在单次压缩目标下几轮就崩溃;解法是跳过紧邻块、在其后的后续块上对完整与压缩上下文算KL散度。

    跳块KL这一个技巧让16甚至32轮迭代压缩仍保持较高精度,是长程可用性的关键。

    555s与602s两个视觉时刻集中在此:崩溃现象与跳块方案的对比图是理解该技巧的最直接证据,值得盯着画面看。▶ 跳到 9:01
  6. 10:55 12:15

    洞见:压缩就是在构造权重

    指出压缩后的KV cache在结构上就是一个MLP——query乘keys是上投影、softmax是非线性、乘values是下投影,因此压缩过程等于从上下文直接构造权重。

    这是不同于梯度下降的第二种产生权重的机制,有望把上下文学习“见一次就会”的样本效率带入持久知识。

    672s的结构对应推导需要跟着画面逐项对照才能真正看懂,是全片概念密度最高的一段。▶ 跳到 10:55
  7. 12:15 13:12

    展望:压缩与梯度下降的结合

    收尾提出未来方向:在同一权重块上先用压缩构造权重、再继续梯度下降,实现样本高效的持续学习。

    记忆的终局是两种权重生成机制协同:压缩负责快速吸收,梯度下降负责长期固化。

    口头展望与总结,无新画面,适合听完收束全片脉络。▶ 跳到 12:15