EN
AI Engineer World's Fair

把生产日志变成可重放考场,让每个修复都被证明有效且不砸坏旧能力

Continual Learning for AI Agents: From Failures to Durable Improvements - Soheil Feizi, RELAI · Soheil Feizi

23 min
AgentEvalsContext

全片 23 分钟·真正值得盯屏约 2 分钟·2 个必看点

橙色 = 推荐必看的 2 分钟其余读导览就够
逐段导览 · 8 段
  1. 0:01 2:40

    上线之后才是开始

    Feizi 先把问题摆正:开发期你有 benchmark 和评估器,上线后这些全没了,Agent 每天在真实用户那里犯错,却没人把这些错误变成改进。

    持续学习要解决的不是「模型不够强」,而是「线上失败白白流失」。

    这段基本是他站着讲问题背景,屏幕上只有一句标题,闭着眼听不亏。▶ 跳到 0:01
    讲者 · Soheil Feizi
  2. 2:40 7:02

    反馈从哪来,学在哪一层

    他拆出两个根本问题:怎么拿到反馈,拿到后怎么行动。反馈有自动化日志分析和人工专家审阅两条互补路径;行动则可以发生在模型权重、harness(提示词/工具/工作流)和记忆三层。

    持续学习不等于微调模型——大量有用的改进本来就该落在提示词、工具和记忆里。

    这是全场的概念骨架,靠语言就能建立起来;他画的分层图只是把话重说了一遍,不看也跟得上。▶ 跳到 2:40
    讲者 · Soheil Feizi
  3. 7:02 10:40

    现有四类方法各缺一块

    逐个点评 SFT/RL/LoRA、trace-to-harness(让 coding agent 直接改 Agent)、GEPA 这类提示词搜索,以及记忆更新,说明每种方法分别卡在哪里。

    成本从高到低排下来,越便宜的方法越没法验证——记忆更新最省,但基本没人证明它真的有效。

    他把四类方法排成一张对照表逐格讲,扫一眼表格就抓得住结构,语速比表格信息量慢,可以适当快进。▶ 跳到 7:02
    讲者 · Soheil Feizi
  4. 10:40 14:02

    可验证持续学习的三条原则

    提出 VCL:失败必须能重放成可打分的测试;修复要路由到真正解释失败的那一层并做最小持久改动;改进要能终身叠加而不是互相覆盖。

    「日志加反馈」不是学习环境——必须补上模拟工具、从日志推断的合成用户和定义成功的评估器,才谈得上可重放。

    全场论证密度最高的一段,画面只有几个原则名词,真正的内容在他的口头推导里,建议不做别的事专心听。▶ 跳到 10:40
    讲者 · Soheil Feizi
  5. 14:02 16:50

    别让新修复砸坏旧能力

    第四条原则「效率」,重点讲回归感知优化:不在过去的学习环境上退步,必须是优化循环内部的硬约束,而不是改完再跑一遍回归测试。

    历史环境只会越攒越多,所以实现复杂度绝不能随环境数量线性增长——这是他认为该领域最难的工程点。

    内容是约束条件的推理,讲得比画面细;这里也是理论转向产品的接缝,听清楚了后面的演示才知道在看什么。▶ 跳到 14:02
    讲者 · Soheil Feizi
  6. 16:50 19:10

    两条命令接进闭环

    切到 Relai 产品,演示如何用两条命令接入现有 Agent,从日志和用户反馈里自动生成学习环境,最后以类似 pull request 的形式产出可人工审阅的版本更新。

    改进结果做成 PR 让人审,是把自动优化关进笼子的关键设计——机器提议,人类批准。

    屏幕上是产品界面和流程图,配合他的解说过一遍即可;真正值得停下来盯的画面在紧接着的实操里。▶ 跳到 16:50
    讲者 · Soheil Feizi
  7. 19:10 21:02

    现场跑一轮:78% → 97%

    仅凭一句自然语言描述场景就生成出完整学习环境,跑模拟发现客服 Agent 只有 78% 且两个评分项明显拖后腿,执行若干轮 rollout 优化后分数升到 97%。

    一轮循环平均提升约 10 个百分点——这个数字是他全场理论唯一的实证支撑,值得记住。

    这段全是屏幕操作:环境生成的配置内容、分数面板上哪两项低、优化后数字怎么跳。只听声音会漏掉一半信息,务必看画面。▶ 跳到 19:10
    讲者 · Soheil Feizi
  8. 21:02 22:34

    收尾:带走这三点

    回到三个关键要点和 VCL 的四原则做总结,重申学习可以发生在模型之外的层,以及每次改进都必须可证明、可叠加。

    如果只带走一句:把线上失败变成能反复重放和打分的测试,是持续学习的入场券。

    总结页就是前面原则的重列,边听边回想自己 Agent 的线上失败属于哪一层,比盯屏幕有用。▶ 跳到 21:02
    讲者 · Soheil Feizi