同一个模型只换搜索工具就逼近上限——瓶颈在检索不在推理
How we taught agents to use good retrieval - Hanna Lichtenberg, Mixedbread AI · Amir
全片 14 分钟·真正值得盯屏约 6 分钟·3 个必看点
- 0:00 – 1:35听
被忽略的那道知识鸿沟
开场抛出全场立论:这几年模型的推理能力指数级往上走,但搜索和检索技术近二十年几乎原地踏步,两者之间裂开一道鸿沟。检索工具是推理层拿到正确知识的唯一主通道。
决定模型能否在法律、金融这类知识密集工作里派上用场的,不是它多会想,而是它能不能拿到对的材料。
这段是纯口头的立论铺垫,画面基本停在标题页,边做别的事听着就行。▶ 跳到 0:00 - 1:35 – 3:35略
两个基准把瓶颈钉死
用 BrowseComp Plus(固定十万文档语料)和 OfficeQA Pro(基于美国百年国债文件构建)两个基准做对照实验:先测出直接把正确文档喂给模型时的上限,再换成默认检索工具在噪声语料里找。
换成默认工具后答案质量掉 8-9 个点,模型没变笨,只是找不到东西——瓶颈被干净地隔离在检索侧。
结论几句话说得完,但支撑它的是几张分数对比图;扫一眼图上的落差幅度再往下听,比死抠每个数字划算。▶ 跳到 1:35 - 3:35 – 5:00看
换个搜索工具就补回来了
把默认工具替换成基于潜在交互的检索方案,成绩立刻回升——一个基准上距离上限只剩 3 个点,另一个几乎完全追平。紧接着展示模型实际写出的查询长什么样。
同一个模型、同一份语料,唯一变量是搜索工具,差距就闭合了;而模型发出的查询是一堆关键词碎片,会把期待自然语言的语义检索系统直接搞懵。
屏幕上那几行真实的查询原文是本段的核心证据,读到具体文字才能体会「乱语」到底乱在哪,跳过就只剩一个抽象说法。▶ 跳到 3:35 - 5:00 – 7:01听
模型为什么学不会问问题
拆解坏查询的三个成因:为编程智能体做的训练养出了正则式抓取习惯;模仿人类在网页搜索框里敲关键词的方式;主流检索基准大量使用实体型短查询,结构上偏袒关键词匹配算法。随后给出一个当场能用的提示词技巧。
别让模型「写一条搜索查询」,改成让它「写一句描述你想找什么的简洁句子」,一句话就能绕开它的关键词旧习惯。
整段是归因推理和一句可以照抄的提示词,没有需要盯着看的内容,听清那句改写就够了。▶ 跳到 5:00 - 7:01 – 9:20看
四个工具各司其职的搜索脚手架
换讲者进入解法部分,逐一介绍搜索智能体的工具编排:一个出概览摘要、一个做十条语义检索、一个按元数据维度筛选、一个负责精确匹配,配合刻意压短的循环和每轮并行发多条查询。
语义检索用来探索问题的不同侧面,精确匹配只做它擅长的定位,把两种能力拆开而不是混在一个工具里,是让查询变自然的前提。
工具分工和调用流程是画出来讲的,讲者也多次指着右侧的示例说明;只听口述容易把四个工具的边界搅混。▶ 跳到 7:01 - 9:20 – 11:30略
怎么诱导出好查询,怎么训出来
先讲脚手架层面的五个设计——先明确要找什么证据、工具职责分离、把提问重构成任务、给出好查询与拆分侧面的少量示例、先跑一次检索让智能体感受语料的用词。再讲训练:故意选小模型保速度,先用大模型当教师做监督微调,再用自研的搜索奖励做在线强化学习。
奖励拆成两半——检索奖励看排序指标和评审对相关性的打分,轨迹奖励专门看查询写得像不像自然句子、探索量是否恰当。
内容密度高但呈现方式是条目式的清单页,跟着标题过一遍结构,重点停在奖励拆解那一屏即可。▶ 跳到 9:20 - 11:30 – 13:10看
训练后的行为与中间成绩
先走查一条训练后的真实调用轨迹,验证行为符合设计预期,再公布尚未发布版本的中间结果。
在该基准上排序指标做到 0.4,而原论文里表现最好的多跳智能体是 0.18,差距超过一倍。
轨迹里每个工具收到什么内容是逐条摊在屏幕上的,这是判断方法是否真的奏效的第一手材料;后半段的成绩对比也是图表呈现。▶ 跳到 11:30 - 13:10 – 14:26略
生产版战绩与收尾
已进入生产的测试版搜索作为 Gemini 3.5 Flash 的检索工具,在 Snowflake MetQA 基准上以 93.4 的准确率排到第一,同时消耗明显低于其他组合,成绩可在公开排行榜自行核对。最后以「检索仍有巨大提升空间」收束。
更好的检索不是拿准确率换成本,这套组合是准确率更高、消耗反而更低。
关键信息就是排行榜截图上的名次和那个准确率数字,看一眼确认,剩下二十秒的结语听着走即可。▶ 跳到 13:10