Meta 一线视角:Agent 评估不是刷榜,是生产工程
Production Evals For Agentic AI Systems - Nishant Gupta, Meta Superintelligence Labs · Nishant Gupta
全片 8 分钟·真正值得盯屏约 2 分钟·3 个必看点
- 0:03 – 1:34听
评估的对象变了
开场立论:Agent 时代要评的不再是模型有没有生成对的答案,而是整个系统的行为对不对——规划质量、工具使用、工作流执行、出错后能不能恢复。
评估对象从单个输出变成系统行为,这是后面所有结论的前提。
这一段基本是讲者站着讲道理,画面只有标题页,边做别的事听着就行。▶ 跳到 0:03讲者 · Nishant Gupta - 1:34 – 2:10略
高分与翻车的脱节
用一组对照展示离线基准分数一路上涨、线上可靠性却依然不可预测。讲者点明二者衡量的根本不是一回事,而且系统越自主,这道缝越宽。
基准衡量模型能力,生产衡量系统行为,两条曲线不会自动收敛。
配了一张分数与线上表现的对照图,讲者也让观众看图。图本身信息量不大,扫一眼确认趋势方向就够,不用逐点研究。▶ 跳到 1:34讲者 · Nishant Gupta - 2:10 – 3:14略
失败模式的层级
把 Agent 的失败摊成一个分层结构:底层是记忆、可靠性和安全问题,中层是推理出错、规划糟糕和工具执行失败,最上层是多智能体之间的协调崩溃。
幻觉只是最底下一小块,只盯模型输出会漏掉绝大部分真实生产风险。
内容是一张分层清单式的示意图,层级关系看图比听讲清楚得多,但每层的字面含义都不难,扫完层级名称即可。▶ 跳到 2:10讲者 · Nishant Gupta - 3:14 – 4:20看
三层评估架构
给出正面方案:基准测试在底、场景化模拟在中、生产遥测在顶。并主张离线评估应该由真实场景驱动,而不是围着一条条提示词打转。
越往上越贵也越有用;离线评估要按场景组织,不是按提示词。
整段围绕金字塔结构图展开,讲者的口头叙述会跳着说各层关系,只有对着图才能把三层的成本与价值权衡串起来。▶ 跳到 3:14讲者 · Nishant Gupta - 4:20 – 5:43听
线上流量就是数据集
论证生产遥测是最重要的评估信号:系统上线后每一次交互都是评估数据,真实流量是任何团队能拿到的最大、最有代表性的数据集。同时提醒 Agent 系统会持续漂移,单次变化都不显眼,没有持续监控就只能等用户投诉。
别再攒静态测试集了,你的线上流量已经是最好的评估集。
这里是纯论证推进,幻灯片只是几行提要,注意力放在讲者的推理链上更划算。▶ 跳到 4:20讲者 · Nishant Gupta - 5:43 – 6:22看
可观测性是前提
展示一次 Agent 执行被完整拆解的追踪视图:推理路径、工具调用、内存访问、执行时间线、状态转换。讲者强调这相当于自主工作流的分布式追踪,传统日志根本不够。
看不见推理路径和状态转换,所谓评估就只是猜。
屏幕上是一张信息密度很高的追踪图,讲者明确指着它讲各个维度,光听会完全丢失这段的价值。▶ 跳到 5:43讲者 · Nishant Gupta - 6:22 – 7:05略
人不是兜底,是评估者
给出一个闭环:遥测先筛出可疑问题,人工集中复核边缘案例,反馈再回流去改进数据集。讲者反对把人类当作出事时的兜底,认为人提供的是自动化给不了的正确性、信任、有用性与安全性判断。
最成功的做法是自动化评估打底 + 有针对性的人工复核,而不是让人守在末端救火。
配的是一张标了环节顺序的闭环流程图,顺着箭头扫一遍就能拿到结构,具体措辞不必细究。▶ 跳到 6:22讲者 · Nishant Gupta - 7:05 – 8:10略
评估作为控制平面
先把每个评估指标逐条对到业务结果上,再抛出收尾主张:评估正从部署前的一次性关卡,变成持续运行的运营闭环,最终演化为一种架构模式——控制平面负责持续观测、收集遥测、跑模拟、协调人工复核,执行平面只负责干活。
用 SRE 的方式建团队:可靠性才是北极星,准确率只是众多输入之一。
前半段是一张指标与业务结果的对照表,值得逐行扫;后半段的控制平面与执行平面分离画得比较简略,听讲者的解释就够。▶ 跳到 7:05讲者 · Nishant Gupta