EN
AI Engineer World's Fair

用真实跑分演示:让 coding agent 自动调优 AI agent 的完整闭环

Agents Building Agents - Alfonso Graziano, Nearform · Alfonso Graziano

30 min
AgentEvalsAI 编程

全片 30 分钟·真正值得盯屏约 13 分钟·3 个必看点

橙色 = 推荐必看的 13 分钟其余读导览就够
逐段导览 · 7 段
  1. 0:00 5:00

    为什么 agent 也能被「测」出来

    先拆 AI agent 由哪些部分构成、能解决哪几类问题,然后引出全场的地基:和领域专家一起攒一套标准题库加判分器。期望答案不一定是文字,也可以是「该调哪个工具、传什么参数、按什么顺序」。

    非确定性系统同样需要测试套件——题库加判分器最终吐出一个准确率数字,用来定基线、防倒退、驱动改进。没有这个数字,后面所有自动优化都无从谈起。

    这段基本是概念页和要点列表,跟着听就够,扫一眼屏幕确认题库长什么样即可。▶ 跳到 0:00
    讲者 · Alfonso Graziano
  2. 5:00 7:06

    一个几乎裸奔的 agent,只有 18%

    现场展示那个没有任何工具的最小 agent,用最朴素的判分方式跑完整套题,通过率 18%。顺带点出 agent 考砸的三大常见原因:没有合适的工具、system prompt 写得不到位、检索不到该有的上下文。

    模型权重里的知识只够应付最简单的问题,剩下的都要靠工具和外部信息;后面大量的所谓优化,其实就是在反复打磨 system prompt。

    屏幕上是真实的 agent 代码和跑分结果,代码有多短、分数有多低要亲眼看,光听数字没感觉。▶ 跳到 5:00
    讲者 · Alfonso Graziano
  3. 7:06 9:56

    灵感来源:让代码 agent 自己做实验

    引用 Karpathy 的自动研究实验:让编码 agent 反复改深度学习算法的代码和超参数,实验次数越多,准确率越高、损失越低。图上每一个点都是一次独立实验。

    只要目标能被自动打分,编码 agent 就能靠海量试错稳定爬坡——把这套搬到 agent 开发上,缺的只是一个「分数」。

    核心是那张散点趋势图,看清横轴是实验轮次、点在往哪个方向走就行,讲解本身可以跟着听。▶ 跳到 7:06
    讲者 · Alfonso Graziano
  4. 9:56 14:10

    自主优化循环:18% 到 83%

    介绍这套自动优化方案的主体:一个循环不断跑评测、改系统代码、换 system prompt、新建工具,再重跑验证。改进覆盖边缘情况、提示词、工具描述乃至工具本身的逻辑,十来轮把那个 18% 的裸 agent 推到 83%。

    改进不只发生在提示词层面——工具怎么描述、工具内部逻辑怎么写,同样是可以被自动试出来的变量。

    循环运行的过程和每轮改动的落点都在屏幕上,看它具体动了哪一行,比听「它会自己改进」抽象描述有用得多。▶ 跳到 9:56
    讲者 · Alfonso Graziano
  5. 14:10 18:24

    一次改动一个假设,退得回去

    讲循环内部的工程约束:每个假设开一条独立分支,改完重跑评测,分数涨了就继续、掉了就回滚,跨轮次用一份记忆文件和历史报告来生成下一个假设。

    失败的假设同样有价值——人回头能读懂它当初想验证什么,据此在下一轮把方向掰正,这也是为什么每一步都要留痕。

    这段主要是流程讲解,听清逻辑即可;唯一值得抬头的是 16:50 前后那份变更记录,每次改进、每次回退和对应假设都被完整记了下来。▶ 跳到 14:10
    讲者 · Alfonso Graziano
  6. 18:24 25:24

    真实生产 agent:67% 到 86%

    换到一个已经被人工调优过的线上 agent,起点 67%,跑完这套循环到 86%,并且确认没有靠篡改题库或判分器蒙混过关。随后展示线上反馈怎么收:点赞点踩加备注,再请领域专家去看真实对话记录做标注。

    必须明确禁止优化过程去动题库和判分标准,否则分数涨得再好看也是自欺;已被人工优化过的系统还能再涨近 20 个百分点,说明人工调优远没有触到天花板。

    前半段的分数对比和后半段的对话记录标注界面都靠画面说话,尤其是专家如何在一条真实记录上标出问题所在。▶ 跳到 18:24
    讲者 · Alfonso Graziano
  7. 25:24 30:12

    修复闭环与给 agent 搭工作台

    收尾讲整个闭环怎么合上:失败模式聚类后由人和领域专家做优先级判断(聚类可能是误报,也可能本来就是预期行为),编码 agent 出修复方案,已有的真实对话记录直接复用为回归测试,所有失败模式沉淀回题库。最后归结到一句话——真正要建设的是让编码 agent 能干活的工作环境。

    决定成败的不是某个聪明的提示词,而是那套工作环境:规格先行、质量闸门(静态检查、单测、评测)、代码审查、上下文供给和可观测性齐了,agent 才能自己改、自己验、自己接着往下改。

    全是方法论收束,没有需要盯的画面,边听边把自己团队缺哪一环对号入座即可。▶ 跳到 25:24
    讲者 · Alfonso Graziano