EN
Cursor Compile

用熵减物理学拆解为何 token 越烧越亏:上下文才是被整个行业忽视的效率另一半

Intelligence Efficiency, Ben Geist | Compile 26 · Ben Geist

15 min
ContextAgent

全片 15 分钟·真正值得盯屏约 5 分钟·3 个必看点

橙色 = 推荐必看的 5 分钟其余读导览就够
逐段导览 · 7 段
  1. 0:00 1:45

    买的是 token,不是智能

    开场抛出核心矛盾:Ramp 数据显示月度 token 支出自 2025 年 1 月以来涨了 13 倍,但智能回报呈对数曲线,Uber、Meta 已开始压制 token maxing。

    为智能付费实际是在为 token 付费,二者并不等价,指数级消耗在经济上不可持续

    支出与智能的对比曲线图(约 48 秒与 70 秒处)值得扫一眼,其余是口头铺垫▶ 跳到 0:00
    讲者 · Ben Geist
  2. 1:45 4:10

    LLM 是一台熵减机器

    结合香农信息熵与热力学熵建模:系统熵能降多少,同时受“投入的功”与“已有信息”双重上界约束——如同打扫房间既要出力也要先知道脏衣服在哪。

    熵降有两个杠杆:功和信息;163 秒处的图表明确了目标——让智能曲线从对数趋向线性

    熵框架是听懂后半场的钥匙,163 秒的关键图表(this graph)需要看,公式推导部分扫幻灯片即可▶ 跳到 1:45
    讲者 · Ben Geist
  3. 4:10 6:11

    行业只押注了一半:功

    指出思维链、推理等当前进步几乎全在“投入更多功”这一侧;而信息侧的主流手段 RAG 和记忆系统扩展性差、只擅长大海捞针式语义检索,且都困在 token 空间而非潜空间。

    效率瓶颈的根源是信息/上下文这一半被忽视,且现有手段没有进入潜空间

    这段是纯论述性批判,无关键画面,适合当播客听▶ 跳到 4:10
    讲者 · Ben Geist
  4. 6:14 9:20

    实验一:多智能体共享 KV 缓存

    经典 supervisor-worker 架构因上下文互不共享而重复探索、极度费 token;为其维护全局共享 KV 缓存,派生新 worker 时按任务压缩过滤出相关上下文来初始化。

    准确率不变的前提下,worker token 减少 42–57%,总 token 减少 21–31%

    396 秒起的架构对比图是理解“低效在哪、缓存怎么共享”的关键,视觉信息密度高▶ 跳到 6:14
    讲者 · Ben Geist
  5. 9:20 11:20

    实验二:稀疏注意力即重排器

    把稀疏注意力建模为重排器:用 DeepSeek lightning indexer 的 query/key 计算文档得分(ReLU 余弦得分按头求和、文档内 token 取均值),在多跳问答数据集上对标重排模型。

    稀疏注意力匹配甚至超越 SOTA 重排模型——它的效率本质上来自对自身上下文的精准检索

    595 秒处的打分公式与对比结果表值得停帧看,讲解本身跟着幻灯片走即可▶ 跳到 9:20
    讲者 · Ben Geist
  6. 11:20 13:17

    实验三:记忆作为独立模态

    与 Stanford SNAP 实验室合作,把上下文注入当作一种模态:记忆模块将文档与查询压缩成 16 个潜表示,直接注入冻结的 Qwen 8B,无需改动基座模型。

    上下文可以绕过 token 空间、以潜表示形式注入冻结 LLM——这是对“信息侧”最激进的重构

    方法描述以口头讲解为主,架构细节听清管线即可,结果图在下一站▶ 跳到 11:20
    讲者 · Ben Geist
  7. 13:17 14:34

    372 倍压缩与三条落地标准

    记忆模块在 TriviaQA 上 exact match 超过 RAG-50(55%),输入表示数量减少 372 倍;收尾提出理想上下文注入模型的三条标准:低延迟、可扩展到大语料、对基座模型零切换成本。

    三条标准是选型清单:低延迟可推理时用、能扩展、新基座模型发布无需重训即可复用

    798 秒的结果图表是全片结论所系,三条标准幻灯片值得截图留存▶ 跳到 13:17
    讲者 · Ben Geist