The Memory Problem, Baseten | Compile 26
把完整KV cache一次前向压成“权重”,补上agent记忆在无损缓存与微调之间缺失的中间层。
全片 13 分钟·真正值得盯屏约 3 分钟·3 个必看点
必看片段 · 直接跳看
全片最实用的工程发现:朴素迭代压缩几轮就崩溃,跳过紧邻块再算KL这一个改动就撑起16-32轮迭代压缩,画面上的对比值得亲眼确认。
全片的思想高潮:压缩后的KV cache结构上就是一个MLP(query乘keys=上投影、softmax=非线性、乘values=下投影),推导过程配合画面才看得清,也是理解“第二种产生权重机制”的钥匙。
一张“选择vs合成×按上下文vs摊销”的矩阵把cartridges、DeepSeek稀疏注意力和本方法各自放进象限,是快速建立领域地图、定位本工作的最佳一分钟。
关键画面 · 点击跳到该处
逐段导览
- 0:00→ 2:30听
记忆问题:两极之间的空档
从长程agentic场景切入:完整KV cache近乎无损但内存线性增长,微调/RAG/写markdown又压缩过狠,中间缺一个记忆层。
要点可靠的长程agent需要三件事:KV空间内的压缩记忆、可循环复用的记忆机制、把经验写回权重的机制。
纯口头的问题陈述与动机铺垫,无关键画面,适合当播客听。▶ 跳到 0:00 - 2:30→ 5:34略
方法版图:2x2矩阵与相关工作定位
用“选择vs合成”ד按上下文vs摊销”的矩阵给KV cache压缩方法分类,并把cartridges(按上下文合成)、DeepSeek稀疏注意力(预训练阶段)与本方法(摊销+合成)放进各自象限。
要点本方法落在“摊销+合成”象限:把优化成本预付到训练阶段,推理时一次前向即可压缩。
核心信息在2x2矩阵幻灯片上(157s、206s两个视觉时刻),扫一眼图即可抓住分类框架,讲解可加速听。▶ 跳到 2:30 - 5:38→ 7:40略
压缩器架构:摊销思想与交叉注意力
借鉴稀疏自编码器的摊销思路,训练一个黑盒压缩器;因KV cache变长,用少量固定query对每个token(K、V拼接后经学习投影)做交叉注意力得到压缩表示。
要点不在推理时对每个上下文跑昂贵优化,而是学一个一次前向就能完成KV cache压缩的函数。
384s处有架构示意幻灯片,看图理解交叉注意力的数据流比纯听更快,其余讲解可略读。▶ 跳到 5:38 - 7:40→ 8:58听
训练细节:恒等初始化与KL蒸馏
两个关键训练决定:输出投影初始化为恒等映射,让训练从不破坏信息的注意力加权混合起步;目标函数是完整与压缩KV cache条件下输出分布的KL蒸馏。
要点KL蒸馏损失迫使模型在压缩前后行为一致——压缩的评判标准是“模型说的话变没变”。
此段是口头展开的训练细节,无独立视觉时刻,两个要点靠听即可完整获取。▶ 跳到 7:40 - 9:01→ 10:55看
迭代压缩为何崩溃、如何救
朴素的“压缩→生成新块→再压缩”循环在单次压缩目标下几轮就崩溃;解法是跳过紧邻块、在其后的后续块上对完整与压缩上下文算KL散度。
要点跳块KL这一个技巧让16甚至32轮迭代压缩仍保持较高精度,是长程可用性的关键。
555s与602s两个视觉时刻集中在此:崩溃现象与跳块方案的对比图是理解该技巧的最直接证据,值得盯着画面看。▶ 跳到 9:01 - 10:55→ 12:15看
洞见:压缩就是在构造权重
指出压缩后的KV cache在结构上就是一个MLP——query乘keys是上投影、softmax是非线性、乘values是下投影,因此压缩过程等于从上下文直接构造权重。
要点这是不同于梯度下降的第二种产生权重的机制,有望把上下文学习“见一次就会”的样本效率带入持久知识。
672s的结构对应推导需要跟着画面逐项对照才能真正看懂,是全片概念密度最高的一段。▶ 跳到 10:55 - 12:15→ 13:12听
展望:压缩与梯度下降的结合
收尾提出未来方向:在同一权重块上先用压缩构造权重、再继续梯度下降,实现样本高效的持续学习。
要点记忆的终局是两种权重生成机制协同:压缩负责快速吸收,梯度下降负责长期固化。
口头展望与总结,无新画面,适合听完收束全片脉络。▶ 跳到 12:15
本站不播放,跳转官方来源观看。
关键观点
- Cursor Compile已收录
现有记忆方案两极分化——完整 KV cache 近乎无损但内存线性增长,微调/RAG/写 markdown 则压缩过狠——中间缺失一个记忆层,补上它是长程 agentic 用例真正可用的关键。
开场对记忆问题的定框,全片方法都围绕填补这个中间层展开。
13 minAgentContext看官方片段 ↗展开视频详情 - Cursor Compile已收录
可靠的长程 agent 需要三个组件:KV cache 空间内的有效压缩记忆、可在循环中被反复使用的记忆机制、以及把经验投影回模型权重变成持久知识的机制。
为整场演讲提供的框架,后续方法分别对应这三个组件。
13 minAgentContext看官方片段 ↗展开视频详情 - Cursor Compile已收录
方法核心是借鉴稀疏自编码器的摊销思想:不在推理时对每个上下文跑昂贵优化(如 cartridges),而是训练一个黑盒函数,一次前向把完整 KV cache 直接映射为压缩 KV cache,把优化成本预付到训练阶段。
从传统稀疏编码到 SAE 的类比——“学习优化器本身”——是该方法与按上下文优化路线的根本区别。
13 minAgentContext看官方片段 ↗展开视频详情 - Cursor Compile已收录
朴素的迭代压缩(压缩→生成新块→再压缩)几轮后就会崩溃;稳定的关键技巧是跳过紧邻块、在其后的后续块上对完整与压缩上下文算 KL 散度,从而支撑 16 甚至 32 轮迭代压缩仍保持较高精度。
这是让压缩记忆能在 agent 循环中被反复使用的核心工程结果。
13 minAgentContext看官方片段 ↗展开视频详情 - Cursor Compile已收录
压缩后的 KV cache 在结构上就是一个 MLP,压缩过程等于从上下文直接构造权重——这是不同于梯度下降的第二种产生权重的机制,有望把上下文学习“见一次就记住”的样本效率带入持久知识;未来方向是在同一权重块上先压缩再继续梯度下降,实现样本高效的持续学习。
全片最具概念冲击力的观点,把 KV cache 压缩与持续学习连接起来。
13 minAgentContext看官方片段 ↗展开视频详情 - Cursor Compile已收录
KV cache 压缩方法可按「选择 vs 合成」×「按上下文 vs 摊销」的 2x2 矩阵分类:cartridges 是按上下文合成,DeepSeek 稀疏注意力示范预训练阶段的选择与合成,而本团队方法落在「摊销 + 合成」象限。
一个可复用的领域地图,便于定位相关工作与理解设计取舍。
13 minAgentContext看官方片段 ↗展开视频详情 - Cursor Compile已收录
压缩器架构用注意力应对变长 KV cache:学习少量固定数量的 query,对 KV cache 中每个 token(K、V 拼接后经学习的 key/value 投影)做交叉注意力得到压缩表示。
方法的具体实现层设计。
13 minAgentContext看官方片段 ↗展开视频详情 - Cursor Compile已收录
两个关键训练细节:输出投影初始化为恒等映射,使训练从不破坏信息的注意力加权混合起步;目标函数是完整与压缩 KV cache 条件下输出分布的 KL 蒸馏损失,迫使压缩前后模型行为一致。
可直接借鉴的训练技巧,决定了压缩器能否稳定收敛。
13 minAgentContext看官方片段 ↗展开视频详情
