EN
AI Engineer World's Fair

不是模型不行,是 agent 没长眼睛:给它造验证工具的实操清单

Your agent is blindfolded — Johan Lajili, Poolside AI · Johan Lajili

10 min
AgentAI 编程Evals

全片 10 分钟·真正值得盯屏约 2 分钟·2 个必看点

橙色 = 推荐必看的 2 分钟其余读导览就够
逐段导览 · 7 段
  1. 0:15 1:20

    同一批工具,两种世界

    开场抛出一个熟悉的场景:同样用 AI 编程,有人觉得脱胎换骨,有人觉得纯属浪费时间。讲者说这个分歧和立场无关。

    体验两极分化不是信仰之争,是有人踩中了某个开关、有人没踩中。

    纯口头铺垫,讲者站着讲观点,画面上没有可看的东西,当播客听即可。▶ 跳到 0:15
    讲者 · Johan Lajili
  2. 1:20 2:35

    「我搞定了」之后你做什么

    真正的分水岭在于:当 agent 宣称「已完成,运行完美」时,一类人当场判定它在胡说并放弃,另一类人让它去查日志、复现问题、再试一次。

    决定成败的不是模型,是你有没有逼 agent 把回路闭上。

    整段是逻辑推演,没有代码或图表落地,闭眼听不损失任何信息。▶ 跳到 1:20
    讲者 · Johan Lajili
  3. 2:35 3:50

    存量项目里的暗礁

    解释为什么绿地项目里 AI 像天才、老项目里像灾难:绿地上 agent 的直觉大多是对的,而老代码里遍布死代码和非常规结构,它会一头撞上去。

    差别不在项目新旧,在于反馈回路——暗礁一直都在,只是 agent 看不见。

    「蒙眼」这个比喻靠讲述展开,没有对应的示意图或案例截图,听比看有效率。▶ 跳到 2:35
    讲者 · Johan Lajili
  4. 3:50 5:00

    工程师该换个岗位了

    提出角色转变:少花时间打磨产品本身,多花时间让 AI 有能力在这个产品上干活——造验证工具、把代码库改得更可操作、把知识库补齐。

    AI 提速的同时也在放大错误,不修好反馈回路,速度本身就是陷阱。

    这是全场的主张部分,讲者的语气和强调本身就是重点,画面无增量。▶ 跳到 3:50
    讲者 · Johan Lajili
  5. 5:00 6:20

    他们给 agent 造了什么

    亮出 Poolside 内部的 CLI 工具:让 agent 能测试 VS Code 扩展形态的产品——截图、经过 token 压缩的页面快照、抽取前后端日志、重启服务,还有「打开某个菜单」「发消息并等待回复」这类封装好的高级命令。

    验证能力要拆成 agent 能一条条调用的原语,不是让它「自己想办法看看」。

    工具清单是逐项口述的,现场并没有把这套 CLI 跑给观众看,所以别等演示画面,直接把这几条记下来对照自己的项目。▶ 跳到 5:00
    讲者 · Johan Lajili
  6. 6:20 7:16

    按自己产品定制感知

    工具要贴着产品形态定制:Unity 游戏可以给 AI 一份 3D 世界的 ASCII 表示,权限体系复杂的系统就让它能一键切换登录身份。并给出两条发现需求的方法——你能看出而它看不出的地方,以及定期让 AI 复盘工作日志找重复动作。

    先确保 AI 能自助验证,再开发新功能;修 bug 前先要求它真的复现一次。

    ASCII 世界表示这类例子是口头描述,没有把实物摆出来,靠听就能建立画面感。▶ 跳到 6:20
    讲者 · Johan Lajili
  7. 7:16 9:42

    问答:它替代自动化测试吗

    回应了一个关键疑问:截图、日志这些验证原语偏临时性,和检入仓库的单元、集成测试是互补关系。讲者认为自动化测试有时过于僵化、维护成本高,更值得做的是模拟人类真实测试应用的方式。

    自主验证的终点是整夜无人值守跑多个 agent——没有它,这个工作流根本不成立。

    问答环节只有对话,提问者未署名,镜头基本固定在讲者身上,纯听即可,也可 1.5 倍速。▶ 跳到 7:16
    讲者 · Johan Lajili