三年一线经验讲透:把 agent 迭代循环整个交给 agent 跑,eval 门是唯一终止条件。
The Agentic AI Engineer - Benedikt Sanftl, Mutagent · Benedikt Sanftl
全片 35 分钟·真正值得盯屏约 8 分钟·3 个必看点
- 0:01 – 7:02听
为什么手工迭代 agent 走不远
从三年构建经验出发论证:改实现、看 traces、A/B 测试这套手工循环的瓶颈在人工评审,部署上百个 agent 时必然崩溃。提出把循环本身 agentic 化、开发者转为循环设计者的核心主张。
人的角色应从『执行迭代』转为『设计循环并设置 eval 终止门』。
纯口头论述铺垫问题与理念,无关键画面,可当播客听。▶ 跳到 0:01讲者 · Benedikt Sanftl - 7:02 – 14:04听
Spec 为蓝图、Eval 为终止条件
讲 spec 应捕获需求、成功标准、上下文与工具边界,并与实现解耦以对冲框架快速演变;eval 驱动开发是 agent 界的 TDD,回答『何时算足够好』。
spec 与实现隔离后,coding agent 可把它实现到任意框架——框架选择权保留在你手里。
概念框架讲解,信息密度在语音而非画面。▶ 跳到 7:02讲者 · Benedikt Sanftl - 14:04 – 18:53听
什么样的 eval 才有用
评估要覆盖整条 trajectory(核对上下文完整性与每个工具输出)而非只看最终输出;主张二元判据优于打分式 LLM-as-judge,且 judge 必须校准评分噪声。
二元判据失败即知道修什么;未校准的 judge 得不出『新版更优』的可信结论。
方法论干货但以口头论证为主,边听边记要点即可。▶ 跳到 14:04讲者 · Benedikt Sanftl - 18:57 – 25:05听
生产诊断与自主优化闭环
上线后按根因给失败模式分组,先派生能检测问题的新 eval 再生成修复,判据回流 spec;有了 eval suite 后即可『改动→实验→全绿自动部署』地自主运行。
完整 eval suite 是发现的产物:真正的边缘案例只能从生产失败和用户反馈中长出来。
闭环逻辑靠讲述串联,无演示画面,注意力放在流程顺序上。▶ 跳到 18:57讲者 · Benedikt Sanftl - 25:11 – 28:17略
Mutagent 平台架构
介绍两个研究预览 agent(评估 agent 与诊断 agent)由 orchestrator 调度、全部跑在用户自己环境中;connectors 接入 traces 与工单、Slack 等反馈渠道,输出可直接提 GitHub PR 或改 MD 形态的 agent 定义。
整套系统运行在用户环境内,输入输出两端都直接对接你现有的工程链路。
以架构图幻灯片为主(1564s 有『as you can see』指图讲解),扫一眼图记住组件关系即可,不必逐句跟。▶ 跳到 25:11讲者 · Benedikt Sanftl - 28:17 – 32:18看
诊断 agent 现场演示
Burak 实操:诊断可 scope 到单个 agent 或 skill,从 Langfuse、本地 Claude transcripts 或 JSONL 取 traces;支持引导式搜索用户上报的特定问题,产出含时间窗频率统计与递归 why 链的 HTML 报告。
报告不止列问题,还沿 why 链追到根因并统计出现频率——这是人工看 traces 给不了的。
全片视觉依赖最强的段落,多个 LLM 判定的关键抽帧(1697s、1850s)都在此:界面操作与报告结构必须亲眼看。▶ 跳到 28:17讲者 · Burak - 32:18 – 34:45看
修复采纳、假设纠偏与任务交付
报告定位问题源头(如某个工具)并给多选式修复建议;assumptions 块显式呈现无代码访问权时的假设供人纠正;全部决策确认后生成 markdown 任务定义,回终端交给 coding agent 执行。
显式暴露假设是让 LLM 诊断可被信任的关键设计,而非事后补丁。
演示的收尾段,三个 LLM 判定的视觉时刻(1938s、1962s、2009s)集中在此,assumptions 块与决策页的界面形态需看画面才能理解。▶ 跳到 32:18讲者 · Burak