Cursor Compile已收录

Intelligence Efficiency, Ben Geist | Compile 26

15 minBen Geist
ContextAgent

用熵减物理学拆解为何 token 越烧越亏:上下文才是被整个行业忽视的效率另一半

全片 15 分钟·真正值得盯屏约 4 分钟·3 个必看点

必看片段 · 直接跳看

关键画面 · 点击跳到该处

谁该看被 token 账单困扰的 AI 基础设施与智能体系统工程师,以及关注 LLM 推理效率研究的从业者
全片时间怎么分
4:23 略读 6:103:58
时间不够?直接从 6:15(374 秒)看到结尾:三个实验依次给出可落地的效率路径,尤其别错过 13:18(798 秒)起的记忆模态结果——超越 RAG 且输入表示减少 372 倍,是全片最硬的数字

逐段导览

现场演示 / 值得盯屏幻灯片图表 / 扫读即可口头论述 / 听就够
  1. 0:001:45

    买的是 token,不是智能

    开场抛出核心矛盾:Ramp 数据显示月度 token 支出自 2025 年 1 月以来涨了 13 倍,但智能回报呈对数曲线,Uber、Meta 已开始压制 token maxing。

    要点为智能付费实际是在为 token 付费,二者并不等价,指数级消耗在经济上不可持续

    支出与智能的对比曲线图(约 48 秒与 70 秒处)值得扫一眼,其余是口头铺垫▶ 跳到 0:00
    讲者 · Ben Geist
  2. 1:454:10

    LLM 是一台熵减机器

    结合香农信息熵与热力学熵建模:系统熵能降多少,同时受“投入的功”与“已有信息”双重上界约束——如同打扫房间既要出力也要先知道脏衣服在哪。

    要点熵降有两个杠杆:功和信息;163 秒处的图表明确了目标——让智能曲线从对数趋向线性

    熵框架是听懂后半场的钥匙,163 秒的关键图表(this graph)需要看,公式推导部分扫幻灯片即可▶ 跳到 1:45
    讲者 · Ben Geist
  3. 4:106:11

    行业只押注了一半:功

    指出思维链、推理等当前进步几乎全在“投入更多功”这一侧;而信息侧的主流手段 RAG 和记忆系统扩展性差、只擅长大海捞针式语义检索,且都困在 token 空间而非潜空间。

    要点效率瓶颈的根源是信息/上下文这一半被忽视,且现有手段没有进入潜空间

    这段是纯论述性批判,无关键画面,适合当播客听▶ 跳到 4:10
    讲者 · Ben Geist
  4. 6:149:20

    实验一:多智能体共享 KV 缓存

    经典 supervisor-worker 架构因上下文互不共享而重复探索、极度费 token;为其维护全局共享 KV 缓存,派生新 worker 时按任务压缩过滤出相关上下文来初始化。

    要点准确率不变的前提下,worker token 减少 42–57%,总 token 减少 21–31%

    396 秒起的架构对比图是理解“低效在哪、缓存怎么共享”的关键,视觉信息密度高▶ 跳到 6:14
    讲者 · Ben Geist
  5. 9:2011:20

    实验二:稀疏注意力即重排器

    把稀疏注意力建模为重排器:用 DeepSeek lightning indexer 的 query/key 计算文档得分(ReLU 余弦得分按头求和、文档内 token 取均值),在多跳问答数据集上对标重排模型。

    要点稀疏注意力匹配甚至超越 SOTA 重排模型——它的效率本质上来自对自身上下文的精准检索

    595 秒处的打分公式与对比结果表值得停帧看,讲解本身跟着幻灯片走即可▶ 跳到 9:20
    讲者 · Ben Geist
  6. 11:2013:17

    实验三:记忆作为独立模态

    与 Stanford SNAP 实验室合作,把上下文注入当作一种模态:记忆模块将文档与查询压缩成 16 个潜表示,直接注入冻结的 Qwen 8B,无需改动基座模型。

    要点上下文可以绕过 token 空间、以潜表示形式注入冻结 LLM——这是对“信息侧”最激进的重构

    方法描述以口头讲解为主,架构细节听清管线即可,结果图在下一站▶ 跳到 11:20
    讲者 · Ben Geist
  7. 13:1714:34

    372 倍压缩与三条落地标准

    记忆模块在 TriviaQA 上 exact match 超过 RAG-50(55%),输入表示数量减少 372 倍;收尾提出理想上下文注入模型的三条标准:低延迟、可扩展到大语料、对基座模型零切换成本。

    要点三条标准是选型清单:低延迟可推理时用、能扩展、新基座模型发布无需重训即可复用

    798 秒的结果图表是全片结论所系,三条标准幻灯片值得截图留存▶ 跳到 13:17
    讲者 · Ben Geist

本站不播放,跳转官方来源观看。

关键观点

  • Cursor Compile已收录

    智能随投入呈对数曲线,智能效率在随时间下降而非上升;让曲线趋向线性的关键是给模型提供更多上下文——共享上下文多智能体与稀疏注意力两个案例共同印证,引入信息/上下文检索本身就能让整个系统大幅更高效。

    基于 Ramp 内部运行的 SWE-bench 变体测量,是全片的核心论题,后续案例均为其实证。

    Ben Geist15 minContextAgent
    看官方片段 ↗展开视频详情
  • Cursor Compile已收录

    为智能付费实际是在为 token 付费,二者并不等价;Ramp 数据显示月度 token 支出自 2025 年 1 月以来增长 13 倍,Uber、Meta 等公司已开始压制 token maxing,指数级 token 消耗在经济上不可持续。

    全片的动机:智能与 token 的价格错配终将反噬采购方,效率问题因此迫在眉睫。

    Ben Geist15 minContextAgent
    看官方片段 ↗展开视频详情
  • Cursor Compile已收录

    把 LLM 与智能体系统建模为“熵减机器”:结合香农信息熵与热力学熵可得,系统熵的可降幅度同时受“投入的功”与“已有信息”双重上界约束——如同打扫房间既要出力也要先知道脏衣服在哪。

    全片的理论框架,为“上下文提升效率”提供数学直觉基础。

    Ben Geist15 minContextAgent
    看官方片段 ↗展开视频详情
  • Cursor Compile已收录

    当前 LLM 的进步(思维链、推理)几乎全部押注在“投入更多功”上;而信息/上下文这一半的主流手段(RAG、记忆系统)扩展性差、只擅长大海捞针式语义检索,在多跳推理上挣扎,且都发生在受限的 token 空间而非潜空间——这是效率瓶颈的根源。

    承接熵减框架的问题诊断:行业忽视了双重约束中的信息侧。

    Ben Geist15 minContextAgent
    看官方片段 ↗展开视频详情
  • Cursor Compile已收录

    经典 supervisor-worker 多智能体架构因上下文互不共享而极度低效;为其维护全局共享 KV 缓存、并在派生新 worker 时按任务压缩过滤出相关上下文来初始化,可在准确率不变的前提下减少 42–57% 的 worker token、21–31% 的总 token。

    第一个实证案例,也是最可直接借鉴的工程结果。

    Ben Geist15 minContextAgent
    看官方片段 ↗展开视频详情
  • Cursor Compile已收录

    稀疏注意力可被建模为重排器:用 DeepSeek 稀疏注意力模型 lightning indexer 的 query/key 计算文档得分,在多跳问答数据集上匹配或超越当前最先进的重排模型——证明稀疏注意力的效率来源于对自身上下文的精准检索。

    第二个实证案例,揭示稀疏注意力与 RAG 重排在机制上同构。

    Ben Geist15 minContextAgent
    看官方片段 ↗展开视频详情
  • Cursor Compile已收录

    与 Stanford SNAP 实验室合作把记忆/上下文注入当作独立模态:用记忆模块把文档与查询压缩成 16 个潜表示直接注入冻结的 Qwen 8B,在 TriviaQA 上 exact match 超过 RAG-50,同时输入端表示数量减少 372 倍。

    第三个实证案例,全片新颖度最高的研究方向:潜空间上下文注入。

    Ben Geist15 minContextAgent
    看官方片段 ↗展开视频详情
  • Cursor Compile已收录

    理想的上下文注入模型应满足三条标准:低延迟以便推理时使用、能扩展到大语料库、对基座 LLM 零切换成本(新模型发布无需重训即可复用);这些研究的落地目标是 Ramp 内部正在生成海量上下文的大型 AI 工具系统。

    面向选型与架构决策的收尾标准,交代研究的实际落地场景。

    Ben Geist15 minContextAgent
    看官方片段 ↗展开视频详情