EN
AI Engineer World's Fair

认出你正在亲手重造的更差版 CI/CD,并用五道门禁拦住它

Every Solo Agent Builder Eventually Reinvents a Worse Version of CI/CD - Sumaiya Shrabony · Sumaiya Shrabony

11 min
AgentEvals

全片 11 分钟·真正值得盯屏约 4 分钟·3 个必看点

橙色 = 推荐必看的 4 分钟其余读导览就够
逐段导览 · 8 段
  1. 0:00 0:51

    你正在重造的东西有名字

    开场直接抛出命题:独立构建 Agent 系统的人,最终都会不自知地重造一遍 CI/CD——只是造出来的是最差的那个版本。

    问题不是你缺工具,而是你已经在造工具了,只是没意识到,所以造得毫无章法。

    纯口头立论,画面只有标题页,边做别的事听着就够。▶ 跳到 0:00
    讲者 · Sumaiya Shrabony
  2. 0:51 2:30

    先看那套教会她的系统

    讲者展示自己实际运行的 Agent 流水线:从输入到最终产物中间有哪些 Agent、在哪些地方交接。

    流水线里每一个交接点,都是系统有机会对你撒谎的地方。

    屏幕上是完整的流程结构,箭头指向哪里、在哪断开,只有看着才成立;后面三个失败案例都会回到这张图上定位。▶ 跳到 0:51
    讲者 · Sumaiya Shrabony
  3. 2:30 4:24

    重造顺序是可预测的

    梳理独立构建者补运维能力的固定路径:先写输出形状测试,再加定时任务告警,然后是边界校验、发布前检查点、全量日志。

    这个顺序不是巧合,是因为 Agent 系统默认不提供任何运维保障,痛点按同样的次序找上门。

    是一段有节奏的清单式论述,听觉信息完整,中途不需要盯屏幕。▶ 跳到 2:30
    讲者 · Sumaiya Shrabony
  4. 4:24 5:18

    最危险的不是坏输出

    指出常见 Agent 演示只展示顺利路径因而具有误导性,转而展示一份看起来完全就绪、实际不该放行的成品。

    Agent 一定会失败,真正的问题是系统把失败包装得漂漂亮亮送往下游。

    全场最关键的一幕:成品的每个部分都齐全、状态显示可发布,破绽必须对着屏幕才看得出来,口头描述完全传达不了那种“看着没毛病”的感觉。▶ 跳到 4:24
    讲者 · Sumaiya Shrabony
  5. 5:18 6:28

    失败一:语音风格漂移

    第一个真实案例——一段通用 AI 营销腔的内容,因为章节齐全、状态正常而被放行。解法不是想办法把它改好,而是在边界上直接拦。

    构建内容系统时,风格契约应该是你设的第一道门禁,它的职责是拒绝而不是修补。

    案例文本以静态对照页呈现,扫一眼那段套话的调性就懂了,不用逐字读完整屏。▶ 跳到 5:18
    讲者 · Sumaiya Shrabony
  6. 6:28 7:29

    失败二:没有来源的断言

    第二个案例——文中出现“减少 37% 返工”这类听起来可信的具体数字,对应的验证记录却是空的。

    系统一旦会输出关于数据或用户的断言却没有验证链,你发布的就是穿着专业外衣的未证实主张——这是信誉问题,不是 Agent 问题。

    精确数字与空白验证记录被并排摆在一起,这种对照的冲击力全在画面上,听讲述会削掉一半。▶ 跳到 6:28
    讲者 · Sumaiya Shrabony
  7. 7:29 8:41

    失败三:反复出现的开场角度

    第三个也是对独立构建者最现实的案例——内容本身是新的、逻辑也通,但开头切入角度和历史产出高度雷同。

    受众会比你更早察觉这种雷同,所以需要一道对照历史库的去重检查。

    这一段主要是几组历史开头的文字罗列,扫过看出重复感即可,没有需要停下细看的画面。▶ 跳到 7:29
    讲者 · Sumaiya Shrabony
  8. 8:41 10:51

    五道无聊门禁与第一步

    收尾给出可直接落地的方案:输出契约、风格契约、验证契约、去重检查、审计追踪,并说明第一步该先画出所有交接点、把门禁放在坏数据代价最高的边界上。

    只记警告的不叫门禁,叫建议——门禁必须能说不并真的阻断产物;在加下一个 Agent 之前,先加一道边界。

    结尾是纯粹的方法论陈述,讲者站着讲完,把这五条记下来比看屏幕更要紧。▶ 跳到 8:41
    讲者 · Sumaiya Shrabony