用 Cursor 的实测数据拆穿「RAG 已死」,讲清检索真正的新形态
RAG is dead, right?? — Kuba Rogut, Turbopuffer · Kuba Rogut
全片 11 分钟·真正值得盯屏约 2 分钟·2 个必看点
- 0:14 – 0:55听
先把靶子立起来
开场直接摆出社交媒体上流行的论调:向量库该扔了,让 agent 拿 grep 翻文件就够。他把这个说法完整复述一遍,作为整场要拆的对象。
争论的核心不是「要不要检索」,而是「检索该长什么样」——这两件事被混为一谈了。
纯口头铺垫,画面上只有一句标题,边做别的事听着就行。▶ 跳到 0:14讲者 · Kuba Rogut - 0:55 – 2:10略
数据不站在唱衰者那边
拿出 Google 搜索量趋势,指出 2025 年中检索/搜索相关的需求不降反升,出现新的暴涨拐点。这是他反驳「已死」的第一手证据。
现实需求在涨,唱衰的是形态而不是需求本身。
屏幕上是一条趋势曲线,扫一眼拐点位置和上扬幅度就够,不用逐句跟着听讲解。▶ 跳到 0:55讲者 · Kuba Rogut - 2:10 – 4:00听
被窄化的 RAG 定义
澄清一个普遍误解:RAG 里的检索从来不只是向量搜索,它包含 BM25 全文检索、grep 和 glob、正则、基础过滤器等一整套手段。把 RAG 等同于「查一次向量库」,是在打一个自己竖的稻草人。
真正过时的是「一次向量查询、结果直接塞满上下文」这种 2023 到 2024 年初的用法,不是检索这件事。
全靠讲者口头拆解概念,画面只是要点罗列,听清楚定义的边界最重要。▶ 跳到 2:10讲者 · Kuba Rogut - 4:00 – 6:15听
agentic search 到底是什么
给出他认为准确的定义:不是「用文件系统 grep 替代数据库」,而是给 agent 一套工具,让它渐进、迭代地找线索并推理。以 Claude Code 为例——反复 grep、读文件、判断信息够不够,够了才继续干活。
agentic retrieval 和 RAG 不是替代关系,前者是后者的执行方式升级:多步推理、按需在语义与全文之间切换。
这一段是全场的概念枢纽,靠举例和推理讲透,没有需要盯着看的东西。▶ 跳到 4:00讲者 · Kuba Rogut - 6:15 – 7:17略
Cursor 的实测收益
亮出 Cursor 内部的上下文基准测试:给模型接上语义搜索后,回答准确率跨模型平均提升约 12.5% 到 13.5%,其 Composer 模型提升接近 24%,并有线上 A/B 测试佐证。
语义索引的收益是能被基准和线上实验同时测出来的,不是理论上的锦上添花。
屏幕上是成组的对比数字,看表比听念数字高效得多;数字之外的解读不多。▶ 跳到 6:15讲者 · Kuba Rogut - 7:17 – 8:50听
不建索引的隐藏账单
算了一笔重复成本的账:没有索引,同一个代码库会被不同开发者的不同 agent 会话反复摸索一遍,单个子步骤就能烧掉数千 token,而这笔开销随人数和天数不断累加。
把解析和嵌入做成一次性前置成本,运行时就只剩轻量查询——省的是 token、时间和真金白银。
成本推演靠讲者一步步算给你听,画面上只有零星示意,用耳朵跟就好。▶ 跳到 7:17讲者 · Kuba Rogut - 8:50 – 10:10听
Merkle 树摊薄团队成本
讲 Cursor 怎么让索引成本不随团队人数线性膨胀:用 Merkle 树算出同事们打开的代码库之间有多相似,相似度够高就直接复制已有索引,只对真正变更的文件重新分块和嵌入。
「索引太贵」的反对意见,在工程上是可以被摊薄掉的——这是全场最可直接借鉴的一招。
机制描述以口述为主,理解「比相似度、只重算差异」这条思路不依赖画面。▶ 跳到 8:50讲者 · Kuba Rogut - 10:10 – 10:53听
上下文再大也要检索
收尾引用 Google 的 Jeff Dean:哪怕上下文窗口做到一万亿 token 也不够用,需要的是分级检索——先把万亿级语料收敛到这一次真正对的那一百万 token。
上下文变大不会消灭检索,只会把检索的任务从「找答案」变成「选对该进窗口的那部分」。
一句引言加一段总结陈词,是全场的落点,听完这段观点就闭环了。▶ 跳到 10:10讲者 · Kuba Rogut