EN
AI Engineer World's Fair

Meta 一线视角:Agent 落不了地,卡的是基建不是模型

Deterministic Infra for Non-Deterministic AI Agents - Nishant Gupta, Meta Superintelligence Labs · Nishant Gupta

7 min
AgentContextAI 产品

全片 7 分钟·真正值得盯屏约 2 分钟·2 个必看点

橙色 = 推荐必看的 2 分钟其余读导览就够
逐段导览 · 7 段
  1. 0:04 1:00

    考题换了:从能力到可靠性

    开场直接把问题重新定义:demo 考的是模型有多聪明,生产系统考的是它有多可靠。讲者主张把 AI Agent 当作分布式系统对待。

    模型是随机的,托住它的基础设施必须是确定性的——工程的主战场因此下沉到模型层以下。

    这段主要是立论和框架铺陈,画面基本是一句话标题页,听着走即可。▶ 跳到 0:04
    讲者 · Nishant Gupta
  2. 1:00 2:00

    云基建与 Agent 的“大错配”

    逐条对照现代云基础设施的四条隐含假设——短请求、确定性服务、已知执行路径、有界失败——与自主 Agent 的有状态、长运行、动态决策、同输入不同工作流。

    Agent 几乎违反了云基建赖以成立的每一条假设,这不是调参能补的错位。

    核心是一张左右对照表,扫一眼两栏就能抓住全部信息,讲解在重复表格内容。▶ 跳到 1:00
    讲者 · Nishant Gupta
  3. 2:00 3:00

    真正的生产事故长什么样

    指出幻觉往往是最不重要的失败模式,真实事故更多是递归推理循环、重试放大、上下文损坏、记忆污染和成本爆炸这类基础设施型失败。

    失控重试最危险:Agent 会反复生成略有变化但同样无效的请求,把一次小报错滚成算力和 GPU 占用的指数增长。

    台上把重试放大的演变过程画成了逐级递增的链路,配着讲解看,比只听“指数增长”这个词直观得多。▶ 跳到 2:00
    讲者 · Nishant Gupta
  4. 3:00 4:00

    老工具箱直接能用

    把 Agent 可靠性问题一一映射到分布式系统数十年的成熟模式:熔断器对应工具隔离,限流对应 Agent 限额,重试策略对应受控恢复,资源配额对应成本治理。

    绝大多数 Agent 基础设施不需要从零发明,找到对应关系就能复用现成方案。

    整段是一张左右映射表,四组对应关系一眼扫完,不必逐句跟。▶ 跳到 3:00
    讲者 · Nishant Gupta
  5. 4:00 4:50

    被低估的记忆问题

    转向 Agent 架构里最容易被忽略的一环:多个 Agent 共享状态时,脏读、更新冲突、上下文漂移这些经典难题会原样复现。

    很多所谓的多 Agent 推理失败,实际上是一致性失败伪装成的。

    讲者在这里对着共享状态的冲突示意图逐条指认,图上标出的读写交错正是他论证的依据,脱开画面听会丢掉一半信息。▶ 跳到 4:00
    讲者 · Nishant Gupta
  6. 4:51 6:05

    模型只建议,平台来决定

    给出全片最推荐的架构原则:绝不让模型直接控制生产系统,改由基础设施校验、策略引擎审批、执行网关强制执行,并叠加提示词控制、工具权限、人工审批与审计构成纵深防御。

    把决策权从模型手里收回到平台,是安全边界唯一站得住的划法。

    这段是纯论证推进,屏幕上只有几行原则要点,闭着眼听不损失内容。▶ 跳到 4:51
    讲者 · Nishant Gupta
  7. 6:05 7:11

    护城河搬到了基建层

    收尾预测:正如容器催生 Kubernetes,Agent 正在催生承担调度、记忆协调、策略执行与评估监控的“Agentic 控制平面”;同时可观测性要从记录“发生了什么”升级到解释“为什么发生”。

    提示词和模型都在快速商品化,下一个差异化前沿是谁的系统更可靠。

    结尾是观点输出和类比推演,没有需要辨认细节的画面。▶ 跳到 6:05
    讲者 · Nishant Gupta