用熵减物理学拆解为何 token 越烧越亏:上下文才是被整个行业忽视的效率另一半
Intelligence Efficiency, Ben Geist | Compile 26 · Ben Geist
全片 15 分钟·真正值得盯屏约 5 分钟·3 个必看点
- 0:00 – 1:45略
买的是 token,不是智能
开场抛出核心矛盾:Ramp 数据显示月度 token 支出自 2025 年 1 月以来涨了 13 倍,但智能回报呈对数曲线,Uber、Meta 已开始压制 token maxing。
为智能付费实际是在为 token 付费,二者并不等价,指数级消耗在经济上不可持续
支出与智能的对比曲线图(约 48 秒与 70 秒处)值得扫一眼,其余是口头铺垫▶ 跳到 0:00讲者 · Ben Geist - 1:45 – 4:10略
LLM 是一台熵减机器
结合香农信息熵与热力学熵建模:系统熵能降多少,同时受“投入的功”与“已有信息”双重上界约束——如同打扫房间既要出力也要先知道脏衣服在哪。
熵降有两个杠杆:功和信息;163 秒处的图表明确了目标——让智能曲线从对数趋向线性
熵框架是听懂后半场的钥匙,163 秒的关键图表(this graph)需要看,公式推导部分扫幻灯片即可▶ 跳到 1:45讲者 · Ben Geist - 4:10 – 6:11听
行业只押注了一半:功
指出思维链、推理等当前进步几乎全在“投入更多功”这一侧;而信息侧的主流手段 RAG 和记忆系统扩展性差、只擅长大海捞针式语义检索,且都困在 token 空间而非潜空间。
效率瓶颈的根源是信息/上下文这一半被忽视,且现有手段没有进入潜空间
这段是纯论述性批判,无关键画面,适合当播客听▶ 跳到 4:10讲者 · Ben Geist - 6:14 – 9:20看
实验一:多智能体共享 KV 缓存
经典 supervisor-worker 架构因上下文互不共享而重复探索、极度费 token;为其维护全局共享 KV 缓存,派生新 worker 时按任务压缩过滤出相关上下文来初始化。
准确率不变的前提下,worker token 减少 42–57%,总 token 减少 21–31%
396 秒起的架构对比图是理解“低效在哪、缓存怎么共享”的关键,视觉信息密度高▶ 跳到 6:14讲者 · Ben Geist - 9:20 – 11:20略
实验二:稀疏注意力即重排器
把稀疏注意力建模为重排器:用 DeepSeek lightning indexer 的 query/key 计算文档得分(ReLU 余弦得分按头求和、文档内 token 取均值),在多跳问答数据集上对标重排模型。
稀疏注意力匹配甚至超越 SOTA 重排模型——它的效率本质上来自对自身上下文的精准检索
595 秒处的打分公式与对比结果表值得停帧看,讲解本身跟着幻灯片走即可▶ 跳到 9:20讲者 · Ben Geist - 11:20 – 13:17听
实验三:记忆作为独立模态
与 Stanford SNAP 实验室合作,把上下文注入当作一种模态:记忆模块将文档与查询压缩成 16 个潜表示,直接注入冻结的 Qwen 8B,无需改动基座模型。
上下文可以绕过 token 空间、以潜表示形式注入冻结 LLM——这是对“信息侧”最激进的重构
方法描述以口头讲解为主,架构细节听清管线即可,结果图在下一站▶ 跳到 11:20讲者 · Ben Geist - 13:17 – 14:34看
372 倍压缩与三条落地标准
记忆模块在 TriviaQA 上 exact match 超过 RAG-50(55%),输入表示数量减少 372 倍;收尾提出理想上下文注入模型的三条标准:低延迟、可扩展到大语料、对基座模型零切换成本。
三条标准是选型清单:低延迟可推理时用、能扩展、新基座模型发布无需重训即可复用
798 秒的结果图表是全片结论所系,三条标准幻灯片值得截图留存▶ 跳到 13:17讲者 · Ben Geist