EN
AI Engineer World's Fair

别让评估信号死在仪表盘——把它回流成检索权重,带基准与现场演示

User Signal Dies at the Retrieval Boundary - Sonam Pankaj, StarlightSearch · Sonam Pankaj

16 min
AgentEvalsContext

全片 16 分钟·真正值得盯屏约 5 分钟·3 个必看点

橙色 = 推荐必看的 5 分钟其余读导览就够
逐段导览 · 8 段
  1. 0:00 1:35

    智能体为什么总在同一个坑里摔倒

    开场直指当前智能体循环(如 ReAct)缺了一环:它执行、观察、再执行,却没有任何机制把“这次成没成”喂回去,于是同一类任务反复失败。随后甩出行业数字:85% 的 AI 项目失败,其中 73% 的流水线问题出在检索环节。

    问题不在模型不够聪明,而在检索器是静态的、从不学习。

    这段配的是一张智能体循环示意图和一页引用数据,图很简单,扫一眼看清楚缺失的那条回边和那两个百分比就可以,讲解本身可以加速听。▶ 跳到 0:00
    讲者 · Sonam Pankaj
  2. 1:35 4:50

    评估信号死在仪表盘里

    讲者描述一个普遍现象:观测系统忠实记录了每一次工具调用和异常,评估系统也判定了输出的对错,但这些结论只停在看板上,从不进入智能体的上下文。结果是改进只能靠工程师盯数据、手改提示词、重新部署,或者干脆换更贵的模型。

    评估与行动之间缺一层,这层缺失把本可自动化的改进变成了人力活。

    全程是概念论述,画面基本停在文字页上,没有需要盯着看的东西,边走边听不会漏信息。▶ 跳到 1:35
    讲者 · Sonam Pankaj
  3. 4:50 7:02

    效用分数:让评估结果参与检索排序

    核心方案登场——检索记忆时不只算语义相似度,还要看这条记忆过去究竟帮到了执行还是拖了后腿,用这个“效用分数”重排结果。配套的运行时层 Agent RGX 让智能体在跑任务的同时改进,区别于 DSPy 那类把经验编译进提示词的做法。

    把评估结果当成检索里的一等信号,改进就发生在运行时,不需要重训或人工调提示词。

    这是全片最需要跟上思路的一段,讲的是排序公式背后的直觉和与编译时方案的分界,画面只是配合的要点页,主要靠听。▶ 跳到 4:50
    讲者 · Sonam Pankaj
  4. 7:02 8:50

    记忆当推理用,验证够了就固化成 Skill

    记忆不该只存“用户喜欢深色主题”这类偏好,而该存任务推理规则,比如“退款前先查结算记录,避免重复退款”。经多次验证的规则会被烘焙进 skill,顺带解决系统提示词长年积累过时信息、没人负责更新的老毛病。这里同时给出成绩:策略遵循基准从 66% 提到 76%,加上 skill 达 80%。

    记忆存的是怎么想,不是记住了什么;验证够次数就沉淀成能力。

    关键内容集中在两处:一句退款规则的例子,和两三张纯数字的成绩对比页。数字看一眼就记住了,不必逐句跟。▶ 跳到 7:02
    讲者 · Sonam Pankaj
  5. 8:50 10:25

    讲者自己承认的三个坑

    少见地花时间讲局限:系统上线初期没有历史轨迹可用的冷启动问题、效用分数随环境变化而漂移、以及反馈标签本身带噪声会污染排序。

    这套机制依赖高质量反馈,冷启动和噪声标签是落地前必须先想清楚的前提。

    三个问题都是口头展开的判断,屏幕上没有对应内容,但对要不要采用这套方案影响很大,建议认真听完。▶ 跳到 8:50
    讲者 · Sonam Pankaj
  6. 10:25 12:40

    现场演示第一幕:它找不到那只鼠标

    切到实际运行的 SQL 商品查询智能体,输入 gaming mouse,检索层一条记忆都没命中,智能体回答目录里没有这款产品——而数据库里确实存在无线鼠标,只是叫法不同。

    静态检索跨不过用户措辞和库存命名之间的那道缝。

    真实终端里的查询、命中为零的检索结果和那句“找不到”的回答同时在屏幕上,失败的每一环都看得见,脱离画面就只剩一句转述。▶ 跳到 10:25
    讲者 · Sonam Pankaj
  7. 12:40 14:26

    现场演示第二幕:反馈提交后当场变样

    把刚才那次失败作为反馈提交,紧接着重跑同一个问题:智能体这次自己改用 wireless mouse 去搜索,成功返回商品。讲者调出前后两次的工具调用记录对照——同一个搜索工具,一次空手而归,一次拿到结果,代码和提示词一个字没动。

    行为改变发生在生产环境的运行时,不需要重新部署。

    全片最有说服力的画面就在这里:两份并排的调用记录,前后差异一眼可辨,这是整场论点唯一的实证落点。▶ 跳到 12:40
    讲者 · Sonam Pankaj
  8. 14:26 15:36

    收尾:分数会一直动,好的沉淀成能力

    回到机制本身收束全场:每条记忆的效用分数会随后续执行记录持续变化,大约经过五轮验证后,它承载的经验就会被固化进 skill,从而在完全不碰系统提示词的情况下更新智能体所依赖的知识。

    评估信号回流形成闭环,智能体的知识更新从此不再靠人改提示词。

    纯口头总结,画面已切回收尾页,听完最后这段闭环的说法就能带走整场的主线。▶ 跳到 14:26
    讲者 · Sonam Pankaj