实测数据证明:AI 编程账单九成花在无关输入上,一层本地检索可砍掉 94%。
We Cut 94% of AI Coding Tokens With a Local Code Index - Rajkumar Sakthivel, Tesco · Rajkumar Sakthivel
全片 11 分钟·真正值得盯屏约 2 分钟·3 个必看点
- 0:00 – 1:30听
账单暴涨的真凶:90% 花在输入
拆解一次 AI 编程查询的成本结构:发送约 4.5 万 token,真正相关的只有约 5 千,约 90% 成本来自无关文件与上下文而非模型输出。
省钱要从输入下手:砍输出 75% 只省约 8% 总成本,砍输入 94% 能省约 61%。
纯口头论述成本结构,无关键画面,专心听数字即可。▶ 跳到 0:00讲者 · Rajkumar Sakthivel - 1:30 – 3:00听
为什么调 prompt 和参数都没用
解释改写 prompt、调 max token 或 temperature 为何省不了钱:模型读到 prompt 之前已接收全部上下文,输入成本已经发生。
输出仅占总成本约 10%,在输出侧做优化天花板极低。
概念性论证,靠讲者推理而非画面,适合听。▶ 跳到 1:30讲者 · Rajkumar Sakthivel - 3:00 – 5:00略
解法:代码库与 AI 之间加一层本地检索
方案架构:按函数/类语义切块,语义与关键词双路并行检索后合并(单路各漏约 1/4,混合后漏检降至约 1/10),再压缩结果并追踪调用关系。
双路混合检索是关键——任何单一检索方式都会漏掉约四分之一的相关结果。
架构讲解配幻灯片示意图,扫一眼流程图即可跟上,不必逐帧细看。▶ 跳到 3:00讲者 · Rajkumar Sakthivel - 5:00 – 7:06听
打分公式与「简单胜过复杂」哲学
相关性判定只用加权公式(语义 50% + 关键词 30% + 时近性 20%,动态阈值),耗时 0.4 毫秒且零额外 AI 调用;整体坚持小数据库、小模型、本地运行。
不必用 AI 判相关性——简单加权公式够用,还省下每次 2-3 秒的自评开销。
工程取舍的口头论述,公式简单到听一遍就能记住。▶ 跳到 5:00讲者 · Rajkumar Sakthivel - 7:06 – 8:20略
FastAPI 实测:94% 削减、90% 准确率
53 文件、20 个真实问题的实测:每问从约 8.3 万 token 降至约 4.9 千,叠加压缩后仅 523 token,检索准确率仍约 90%,测试公开可复现。
94% 的 token 削减没有以准确率为代价——这是全片最硬的证据。
结果数据以图表呈现(visualMoment 426s),扫读数字表格即可抓住重点。▶ 跳到 7:06讲者 · Rajkumar Sakthivel - 8:20 – 9:29听
诚实的边界:什么时候会失效
坦承 94% 是以「每次读完整文件」为基线的最坏情况对比,Claude Code 等工具本身更智能,实际节省会更低;在 396 文件的混杂产品代码库上召回率几乎归零。
文件各司其职时方案有效,单文件承担多职责的大型混杂代码库会让它失效。
关于适用边界的口头坦白,是判断该方案是否适合你的关键,认真听。▶ 跳到 8:20讲者 · Rajkumar Sakthivel - 9:29 – 10:25略
真实账单与共享索引设想
展示真实项目账单:247 次查询省 1240 万 token、约 186 美元(84% 来自检索层);并提出多工具共享统一索引和持久记忆——代码库只需向 AI 解释一次。
模型或许只占总成本约 30%,其余取决于你喂什么——先修输入,再谈换模型。
账单数据画面(visualMoment 569s)值得扫一眼核实数字来源,其余论述听即可。▶ 跳到 9:29讲者 · Rajkumar Sakthivel - 10:25 – 10:41略
上手方式:CCE 开源工具
收尾给出行动路径:CCE 一条命令即可试用,免费开源,建议在自己项目跑一周看真实节省数字。
结论可以自己验证,不必只信讲者的数字。
画面展示命令与工具入口(visualMoment 625s),扫一眼记下工具名即可。▶ 跳到 10:25讲者 · Rajkumar Sakthivel