EN
AI Engineer World's Fair

同一个模型只换搜索工具就逼近上限——瓶颈在检索不在推理

How we taught agents to use good retrieval - Hanna Lichtenberg, Mixedbread AI · Amir

14 min
AgentEvalsContext

全片 14 分钟·真正值得盯屏约 6 分钟·3 个必看点

橙色 = 推荐必看的 6 分钟其余读导览就够
逐段导览 · 8 段
  1. 0:00 1:35

    被忽略的那道知识鸿沟

    开场抛出全场立论:这几年模型的推理能力指数级往上走,但搜索和检索技术近二十年几乎原地踏步,两者之间裂开一道鸿沟。检索工具是推理层拿到正确知识的唯一主通道。

    决定模型能否在法律、金融这类知识密集工作里派上用场的,不是它多会想,而是它能不能拿到对的材料。

    这段是纯口头的立论铺垫,画面基本停在标题页,边做别的事听着就行。▶ 跳到 0:00
  2. 1:35 3:35

    两个基准把瓶颈钉死

    用 BrowseComp Plus(固定十万文档语料)和 OfficeQA Pro(基于美国百年国债文件构建)两个基准做对照实验:先测出直接把正确文档喂给模型时的上限,再换成默认检索工具在噪声语料里找。

    换成默认工具后答案质量掉 8-9 个点,模型没变笨,只是找不到东西——瓶颈被干净地隔离在检索侧。

    结论几句话说得完,但支撑它的是几张分数对比图;扫一眼图上的落差幅度再往下听,比死抠每个数字划算。▶ 跳到 1:35
  3. 3:35 5:00

    换个搜索工具就补回来了

    把默认工具替换成基于潜在交互的检索方案,成绩立刻回升——一个基准上距离上限只剩 3 个点,另一个几乎完全追平。紧接着展示模型实际写出的查询长什么样。

    同一个模型、同一份语料,唯一变量是搜索工具,差距就闭合了;而模型发出的查询是一堆关键词碎片,会把期待自然语言的语义检索系统直接搞懵。

    屏幕上那几行真实的查询原文是本段的核心证据,读到具体文字才能体会「乱语」到底乱在哪,跳过就只剩一个抽象说法。▶ 跳到 3:35
  4. 5:00 7:01

    模型为什么学不会问问题

    拆解坏查询的三个成因:为编程智能体做的训练养出了正则式抓取习惯;模仿人类在网页搜索框里敲关键词的方式;主流检索基准大量使用实体型短查询,结构上偏袒关键词匹配算法。随后给出一个当场能用的提示词技巧。

    别让模型「写一条搜索查询」,改成让它「写一句描述你想找什么的简洁句子」,一句话就能绕开它的关键词旧习惯。

    整段是归因推理和一句可以照抄的提示词,没有需要盯着看的内容,听清那句改写就够了。▶ 跳到 5:00
  5. 7:01 9:20

    四个工具各司其职的搜索脚手架

    换讲者进入解法部分,逐一介绍搜索智能体的工具编排:一个出概览摘要、一个做十条语义检索、一个按元数据维度筛选、一个负责精确匹配,配合刻意压短的循环和每轮并行发多条查询。

    语义检索用来探索问题的不同侧面,精确匹配只做它擅长的定位,把两种能力拆开而不是混在一个工具里,是让查询变自然的前提。

    工具分工和调用流程是画出来讲的,讲者也多次指着右侧的示例说明;只听口述容易把四个工具的边界搅混。▶ 跳到 7:01
  6. 9:20 11:30

    怎么诱导出好查询,怎么训出来

    先讲脚手架层面的五个设计——先明确要找什么证据、工具职责分离、把提问重构成任务、给出好查询与拆分侧面的少量示例、先跑一次检索让智能体感受语料的用词。再讲训练:故意选小模型保速度,先用大模型当教师做监督微调,再用自研的搜索奖励做在线强化学习。

    奖励拆成两半——检索奖励看排序指标和评审对相关性的打分,轨迹奖励专门看查询写得像不像自然句子、探索量是否恰当。

    内容密度高但呈现方式是条目式的清单页,跟着标题过一遍结构,重点停在奖励拆解那一屏即可。▶ 跳到 9:20
  7. 11:30 13:10

    训练后的行为与中间成绩

    先走查一条训练后的真实调用轨迹,验证行为符合设计预期,再公布尚未发布版本的中间结果。

    在该基准上排序指标做到 0.4,而原论文里表现最好的多跳智能体是 0.18,差距超过一倍。

    轨迹里每个工具收到什么内容是逐条摊在屏幕上的,这是判断方法是否真的奏效的第一手材料;后半段的成绩对比也是图表呈现。▶ 跳到 11:30
  8. 13:10 14:26

    生产版战绩与收尾

    已进入生产的测试版搜索作为 Gemini 3.5 Flash 的检索工具,在 Snowflake MetQA 基准上以 93.4 的准确率排到第一,同时消耗明显低于其他组合,成绩可在公开排行榜自行核对。最后以「检索仍有巨大提升空间」收束。

    更好的检索不是拿准确率换成本,这套组合是准确率更高、消耗反而更低。

    关键信息就是排行榜截图上的名次和那个准确率数字,看一眼确认,剩下二十秒的结语听着走即可。▶ 跳到 13:10