Agent 上线后如何自动发现问题、发 PR、把关?Wandero 半小时闭环的生产级实践。
The Missing Layer After Launch - Raphael Kalandadze, Wandero AI · Raphael Kalandadze
全片 20 分钟·真正值得盯屏约 4 分钟·2 个必看点
- 0:00 – 3:30听
为什么发布才是真正的开始
以 Wandero 生产实践开场:构建已是最容易的部分,Agent 没有预定义流程、功能面无限,上线前不可能把所有对话路径写成测试。
发布后的反馈闭环是当前普遍缺失的一层,重要性至少与产品本身相当。
纯口头立论,无画面依赖,适合当播客听。▶ 跳到 0:00讲者 · Raphael Kalandadze - 3:30 – 7:02听
最危险的失败是看不见的
列举静默失败:Agent 靠运气找 workaround、未实际验证就标记完成、流程跑完却订错服务——仪表盘不报红,技术上成功而任务上失败。
单元测试和规则检查只覆盖问题的一个切片,只有生产环境才教会你最初该测什么。
案例靠讲述展开,本章无值得抽帧的画面。▶ 跳到 3:30讲者 · Raphael Kalandadze - 7:02 – 10:00听
快速闭环:三类 Agent 串成流水线
日志监控 Agent 每 15 分钟到 1 小时深入日志判断用户是否被卡住,触发修复 Agent 发 PR 或 Slack 告警,再由全新上下文的独立评审 Agent 批判把关。
校准后从发现问题到 PR 就绪只需半小时,评审 Agent 的独立上下文是质量关键。
架构讲解为主,画面信息量低,专注听三个角色的分工即可。▶ 跳到 7:02讲者 · Raphael Kalandadze - 10:00 – 12:00略
别让人类成为瓶颈
Agent 产出的 PR 自带图表与元数据、几分钟可看懂;PR Agent 加评审 Agent 的日产出已是三名人类工程师的十倍。
先把闭环校准到“你是唯一瓶颈”的可信程度,之后再把人移出环路就很容易。
600s 附近的 PR 示例(Mermaid 图表、元数据)值得扫一眼,其余论述可快速略过。▶ 跳到 10:00讲者 · Raphael Kalandadze - 12:00 – 14:04听
拉远镜头:Session Analyzer
第二条轨道负责高层健康度:对每个对话打分、聚类问题、连点成线,每周跑一两次即可纵览成百上千个真实对话。
快速修单点问题之外,必须有人回答“系统整体健康吗”——这就是保持系统手感的方式。
概念铺垫段,具体效果留到下一站的现场演示,先听懂设计意图。▶ 跳到 12:00讲者 · Raphael Kalandadze - 14:04 – 15:50看
现场演示:健康度仪表盘与 AI 洞察
打开自建仪表盘实机展示:系统健康度、被分析会话数、成本,以及 AI 洞察对每个关键问题给出根因与修复建议,配评分分布、情感分析、工具调用与拒绝率。
仪表盘最有价值的不是指标,而是 Agent 连点成线找出模式的 AI 洞察。
850s “让我给你们看一个例子”起进入实机演示,873s 与 894s 均被判定为值得抽帧的画面,必须看屏幕。▶ 跳到 14:04讲者 · Raphael Kalandadze - 15:50 – 17:20看
补上用户视角:computer-use 模拟真实操作
日志和代码视角之外,用 computer-use Agent 打开浏览器、登录并模拟真实客户操作,抓 UI 层面日志看不到的问题;为自家 DOM 定制专用 skill 比通用浏览器操作快得多,但要预期高 token 消耗。
给监控 Agent 与人类工程师同等的访问面——日志、轨迹、指标、数据库、UI 一个都不能少。
本章有演示画面,982s 处的用户视角测试是理解“同等访问面”主张的关键一幕。▶ 跳到 15:50讲者 · Raphael Kalandadze - 17:20 – 19:32听
结论:Meta Harness 才是护城河
收束全场:护城河不是模型,而是围绕模型的自我监控、自我改进、自动闭环的 meta harness 系统。
把整套发布后运维本身做成能自我观察与自我修复的系统,才是别人抄不走的东西。
口头总结与升华,适合听完收尾观点。▶ 跳到 17:20讲者 · Raphael Kalandadze