50万传感器压垮LLM后,他们把检索还给了确定性代码
Semantic Blindness: 500,000 Sensors Confused an LLM - Raahul Singh & Vanč Levstik, Phaidra
全片 16 分钟·真正值得盯屏约 3 分钟·3 个必看点
- 0:00 – 2:10听
问题登场:命名混乱的五十万个传感器
开场交代 Phaidra 做的是工厂运维 Agent,以及它撞上的那堵墙:行业对传感器命名毫无统一规范,一座 1GW 级工厂有约五十万个名字各异的测点。
Demo 只需跑通一个场景,产品必须对所有场景生效且不能静默失败——这条线就是规模化的分水岭。
这段基本是在铺陈业务背景和问题定义,讲者靠语言推进,画面停在标题页,听着走就够了。▶ 跳到 0:00 - 2:10 – 5:41听
三次失败:向量检索、频率惩罚与幽灵设备
复盘三条走不通的路:向量检索分不清只差一个字符的 chiller 6 和 chiller 7;连续吐出大量相似 token 会触发模型的频率惩罚导致提前中断;朴素的分而治之则让模型凭空发明设备、又悄悄丢掉真实设备。
在任务关键系统里,静默丢弃比报错更致命——用户一旦发现结果里有幻觉设备,信任就再也建不回来。
三个失败案例是靠具体例子和推理串起来的,屏幕上没有需要辨认的结构图,专心听讲者的因果链即可。▶ 跳到 2:10 - 5:41 – 7:01略
转机:工厂本来就是一棵树
指出 AI 工厂天然呈层级结构——数据中心到数据厅到通道到机架到 GPU,冷机房到冷机到水泵到冷却塔。随后提出「线性化器」:不给模型全量节点,只给系统图的摘要表示。
成本该随层级深度扩展,而不是随设备实例数扩展;深度增长极慢,宽度才是爆炸的那一维。
这里屏幕上是层级树的示意图,配合讲解扫一眼就能抓住深度与宽度的对比,图看懂了后面的方案就顺了。▶ 跳到 5:41 - 7:01 – 10:31略
让模型只写计划,不读名单
新架构的核心:模型不再遍历任何设备名称,只产出一份结构化查询计划——收集什么对象、在哪棵子树的范围内、按什么条件过滤,后端用预建索引和集合运算求交集。极模糊的问法则让模型生成待匹配的模式,而不是去读名字列表。
能写下来的结构和规则就该交给确定性代码:检索、集合逻辑、计数、去重必须百分之百可复现,模型只留下解析模糊意图和合成人话答案这两件它真正擅长的事。
屏幕上把查询计划拆成了三个具名的部分并配了例子,边看边听能省下反复回放的工夫;例子讲完后转入原则阐述,可以加速。▶ 跳到 7:01 - 10:31 – 11:59略
只有两三步的短回路
展示端到端链路:用户提问,规划模型解析意图并产出搜索计划,确定性求解器做索引与集合运算,直接返回结果集。整条路径只有两三步。
刻意不做可能无限循环的多步 Agent 回路,步数封死,总成本才能保持平坦。
配的是一张从提问到结果集的流程示意,箭头没几根,扫一眼就能确认「短」到底短在哪里。▶ 跳到 10:31 - 11:59 – 13:38略
生产数据:满分准确率与三百倍降本
换人讲评测结果。旧方案在 64 卡规模约八成正确率,扩到约 46 万卡跌至三成左右;新方案在所有规模以及六套真实生产系统的 66 个用例上零失败。单次评测的 token 从 1.16 亿降到 39 万。
单次查询恒定在约九千 token,意味着客户扩容时这部分成本根本不涨——这才是「亚线性扩展」的商业含义。
两组对照数据都以图表呈现,数字之间的落差看图一秒到位,光听念数字反而容易糊掉。▶ 跳到 11:59 - 13:41 – 16:23听
反着走 Karpathy 曲线
收尾升华为方法论:AI 原生软件应该从近乎纯粹的软件 3.0 起步,在 Demo 阶段把一切塞进上下文快速验证价值,撞上真实规模后再把可建模的那部分迁回软件 1.0 完成生产化。
每写下一个确定性函数,就等于给模型多铺了一块可靠的落脚石——迁移方向是从 3.0 退回 1.0,而不是相反。
这段是观点总结,讲者主要在讲自己的判断和取舍逻辑,画面只是一条示意曲线,听比看重要。▶ 跳到 13:41