Intelligence Efficiency, Ben Geist | Compile 26
用熵减物理学拆解为何 token 越烧越亏:上下文才是被整个行业忽视的效率另一半
全片 15 分钟·真正值得盯屏约 4 分钟·3 个必看点
必看片段 · 直接跳看
关键画面 · 点击跳到该处
逐段导览
- 0:00→ 1:45略
买的是 token,不是智能
开场抛出核心矛盾:Ramp 数据显示月度 token 支出自 2025 年 1 月以来涨了 13 倍,但智能回报呈对数曲线,Uber、Meta 已开始压制 token maxing。
要点为智能付费实际是在为 token 付费,二者并不等价,指数级消耗在经济上不可持续
支出与智能的对比曲线图(约 48 秒与 70 秒处)值得扫一眼,其余是口头铺垫▶ 跳到 0:00讲者 · Ben Geist - 1:45→ 4:10略
LLM 是一台熵减机器
结合香农信息熵与热力学熵建模:系统熵能降多少,同时受“投入的功”与“已有信息”双重上界约束——如同打扫房间既要出力也要先知道脏衣服在哪。
要点熵降有两个杠杆:功和信息;163 秒处的图表明确了目标——让智能曲线从对数趋向线性
熵框架是听懂后半场的钥匙,163 秒的关键图表(this graph)需要看,公式推导部分扫幻灯片即可▶ 跳到 1:45讲者 · Ben Geist - 4:10→ 6:11听
行业只押注了一半:功
指出思维链、推理等当前进步几乎全在“投入更多功”这一侧;而信息侧的主流手段 RAG 和记忆系统扩展性差、只擅长大海捞针式语义检索,且都困在 token 空间而非潜空间。
要点效率瓶颈的根源是信息/上下文这一半被忽视,且现有手段没有进入潜空间
这段是纯论述性批判,无关键画面,适合当播客听▶ 跳到 4:10讲者 · Ben Geist - 6:14→ 9:20看
实验一:多智能体共享 KV 缓存
经典 supervisor-worker 架构因上下文互不共享而重复探索、极度费 token;为其维护全局共享 KV 缓存,派生新 worker 时按任务压缩过滤出相关上下文来初始化。
要点准确率不变的前提下,worker token 减少 42–57%,总 token 减少 21–31%
396 秒起的架构对比图是理解“低效在哪、缓存怎么共享”的关键,视觉信息密度高▶ 跳到 6:14讲者 · Ben Geist - 9:20→ 11:20略
实验二:稀疏注意力即重排器
把稀疏注意力建模为重排器:用 DeepSeek lightning indexer 的 query/key 计算文档得分(ReLU 余弦得分按头求和、文档内 token 取均值),在多跳问答数据集上对标重排模型。
要点稀疏注意力匹配甚至超越 SOTA 重排模型——它的效率本质上来自对自身上下文的精准检索
595 秒处的打分公式与对比结果表值得停帧看,讲解本身跟着幻灯片走即可▶ 跳到 9:20讲者 · Ben Geist - 11:20→ 13:17听
实验三:记忆作为独立模态
与 Stanford SNAP 实验室合作,把上下文注入当作一种模态:记忆模块将文档与查询压缩成 16 个潜表示,直接注入冻结的 Qwen 8B,无需改动基座模型。
要点上下文可以绕过 token 空间、以潜表示形式注入冻结 LLM——这是对“信息侧”最激进的重构
方法描述以口头讲解为主,架构细节听清管线即可,结果图在下一站▶ 跳到 11:20讲者 · Ben Geist - 13:17→ 14:34看
372 倍压缩与三条落地标准
记忆模块在 TriviaQA 上 exact match 超过 RAG-50(55%),输入表示数量减少 372 倍;收尾提出理想上下文注入模型的三条标准:低延迟、可扩展到大语料、对基座模型零切换成本。
要点三条标准是选型清单:低延迟可推理时用、能扩展、新基座模型发布无需重训即可复用
798 秒的结果图表是全片结论所系,三条标准幻灯片值得截图留存▶ 跳到 13:17讲者 · Ben Geist
本站不播放,跳转官方来源观看。
关键观点
- Cursor Compile已收录
智能随投入呈对数曲线,智能效率在随时间下降而非上升;让曲线趋向线性的关键是给模型提供更多上下文——共享上下文多智能体与稀疏注意力两个案例共同印证,引入信息/上下文检索本身就能让整个系统大幅更高效。
基于 Ramp 内部运行的 SWE-bench 变体测量,是全片的核心论题,后续案例均为其实证。
Ben Geist15 minContextAgent看官方片段 ↗展开视频详情 - Cursor Compile已收录
为智能付费实际是在为 token 付费,二者并不等价;Ramp 数据显示月度 token 支出自 2025 年 1 月以来增长 13 倍,Uber、Meta 等公司已开始压制 token maxing,指数级 token 消耗在经济上不可持续。
全片的动机:智能与 token 的价格错配终将反噬采购方,效率问题因此迫在眉睫。
Ben Geist15 minContextAgent看官方片段 ↗展开视频详情 - Cursor Compile已收录
把 LLM 与智能体系统建模为“熵减机器”:结合香农信息熵与热力学熵可得,系统熵的可降幅度同时受“投入的功”与“已有信息”双重上界约束——如同打扫房间既要出力也要先知道脏衣服在哪。
全片的理论框架,为“上下文提升效率”提供数学直觉基础。
Ben Geist15 minContextAgent看官方片段 ↗展开视频详情 - Cursor Compile已收录
当前 LLM 的进步(思维链、推理)几乎全部押注在“投入更多功”上;而信息/上下文这一半的主流手段(RAG、记忆系统)扩展性差、只擅长大海捞针式语义检索,在多跳推理上挣扎,且都发生在受限的 token 空间而非潜空间——这是效率瓶颈的根源。
承接熵减框架的问题诊断:行业忽视了双重约束中的信息侧。
Ben Geist15 minContextAgent看官方片段 ↗展开视频详情 - Cursor Compile已收录
经典 supervisor-worker 多智能体架构因上下文互不共享而极度低效;为其维护全局共享 KV 缓存、并在派生新 worker 时按任务压缩过滤出相关上下文来初始化,可在准确率不变的前提下减少 42–57% 的 worker token、21–31% 的总 token。
第一个实证案例,也是最可直接借鉴的工程结果。
Ben Geist15 minContextAgent看官方片段 ↗展开视频详情 - Cursor Compile已收录
稀疏注意力可被建模为重排器:用 DeepSeek 稀疏注意力模型 lightning indexer 的 query/key 计算文档得分,在多跳问答数据集上匹配或超越当前最先进的重排模型——证明稀疏注意力的效率来源于对自身上下文的精准检索。
第二个实证案例,揭示稀疏注意力与 RAG 重排在机制上同构。
Ben Geist15 minContextAgent看官方片段 ↗展开视频详情 - Cursor Compile已收录
与 Stanford SNAP 实验室合作把记忆/上下文注入当作独立模态:用记忆模块把文档与查询压缩成 16 个潜表示直接注入冻结的 Qwen 8B,在 TriviaQA 上 exact match 超过 RAG-50,同时输入端表示数量减少 372 倍。
第三个实证案例,全片新颖度最高的研究方向:潜空间上下文注入。
Ben Geist15 minContextAgent看官方片段 ↗展开视频详情 - Cursor Compile已收录
理想的上下文注入模型应满足三条标准:低延迟以便推理时使用、能扩展到大语料库、对基座 LLM 零切换成本(新模型发布无需重训即可复用);这些研究的落地目标是 Ramp 内部正在生成海量上下文的大型 AI 工具系统。
面向选型与架构决策的收尾标准,交代研究的实际落地场景。
Ben Geist15 minContextAgent看官方片段 ↗展开视频详情





