EN
AI Engineer World's Fair

50万传感器压垮LLM后,他们把检索还给了确定性代码

Semantic Blindness: 500,000 Sensors Confused an LLM - Raahul Singh & Vanč Levstik, Phaidra

16 min
AgentContextEvalsAI 产品

全片 16 分钟·真正值得盯屏约 3 分钟·3 个必看点

橙色 = 推荐必看的 3 分钟其余读导览就够
逐段导览 · 7 段
  1. 0:00 2:10

    问题登场:命名混乱的五十万个传感器

    开场交代 Phaidra 做的是工厂运维 Agent,以及它撞上的那堵墙:行业对传感器命名毫无统一规范,一座 1GW 级工厂有约五十万个名字各异的测点。

    Demo 只需跑通一个场景,产品必须对所有场景生效且不能静默失败——这条线就是规模化的分水岭。

    这段基本是在铺陈业务背景和问题定义,讲者靠语言推进,画面停在标题页,听着走就够了。▶ 跳到 0:00
  2. 2:10 5:41

    三次失败:向量检索、频率惩罚与幽灵设备

    复盘三条走不通的路:向量检索分不清只差一个字符的 chiller 6 和 chiller 7;连续吐出大量相似 token 会触发模型的频率惩罚导致提前中断;朴素的分而治之则让模型凭空发明设备、又悄悄丢掉真实设备。

    在任务关键系统里,静默丢弃比报错更致命——用户一旦发现结果里有幻觉设备,信任就再也建不回来。

    三个失败案例是靠具体例子和推理串起来的,屏幕上没有需要辨认的结构图,专心听讲者的因果链即可。▶ 跳到 2:10
  3. 5:41 7:01

    转机:工厂本来就是一棵树

    指出 AI 工厂天然呈层级结构——数据中心到数据厅到通道到机架到 GPU,冷机房到冷机到水泵到冷却塔。随后提出「线性化器」:不给模型全量节点,只给系统图的摘要表示。

    成本该随层级深度扩展,而不是随设备实例数扩展;深度增长极慢,宽度才是爆炸的那一维。

    这里屏幕上是层级树的示意图,配合讲解扫一眼就能抓住深度与宽度的对比,图看懂了后面的方案就顺了。▶ 跳到 5:41
  4. 7:01 10:31

    让模型只写计划,不读名单

    新架构的核心:模型不再遍历任何设备名称,只产出一份结构化查询计划——收集什么对象、在哪棵子树的范围内、按什么条件过滤,后端用预建索引和集合运算求交集。极模糊的问法则让模型生成待匹配的模式,而不是去读名字列表。

    能写下来的结构和规则就该交给确定性代码:检索、集合逻辑、计数、去重必须百分之百可复现,模型只留下解析模糊意图和合成人话答案这两件它真正擅长的事。

    屏幕上把查询计划拆成了三个具名的部分并配了例子,边看边听能省下反复回放的工夫;例子讲完后转入原则阐述,可以加速。▶ 跳到 7:01
  5. 10:31 11:59

    只有两三步的短回路

    展示端到端链路:用户提问,规划模型解析意图并产出搜索计划,确定性求解器做索引与集合运算,直接返回结果集。整条路径只有两三步。

    刻意不做可能无限循环的多步 Agent 回路,步数封死,总成本才能保持平坦。

    配的是一张从提问到结果集的流程示意,箭头没几根,扫一眼就能确认「短」到底短在哪里。▶ 跳到 10:31
  6. 11:59 13:38

    生产数据:满分准确率与三百倍降本

    换人讲评测结果。旧方案在 64 卡规模约八成正确率,扩到约 46 万卡跌至三成左右;新方案在所有规模以及六套真实生产系统的 66 个用例上零失败。单次评测的 token 从 1.16 亿降到 39 万。

    单次查询恒定在约九千 token,意味着客户扩容时这部分成本根本不涨——这才是「亚线性扩展」的商业含义。

    两组对照数据都以图表呈现,数字之间的落差看图一秒到位,光听念数字反而容易糊掉。▶ 跳到 11:59
  7. 13:41 16:23

    反着走 Karpathy 曲线

    收尾升华为方法论:AI 原生软件应该从近乎纯粹的软件 3.0 起步,在 Demo 阶段把一切塞进上下文快速验证价值,撞上真实规模后再把可建模的那部分迁回软件 1.0 完成生产化。

    每写下一个确定性函数,就等于给模型多铺了一块可靠的落脚石——迁移方向是从 3.0 退回 1.0,而不是相反。

    这段是观点总结,讲者主要在讲自己的判断和取舍逻辑,画面只是一条示意曲线,听比看重要。▶ 跳到 13:41