EN
AI Engineer World's Fair

把15个工具换成一个REPL,表格智能体准确率从50%做到92%的完整失败复盘

Teaching Coding Agents to do Spreadsheets - Nuno Campos, Witan Labs · Nuno Campos

19 min
AgentAI 编程EvalsContext

全片 19 分钟·真正值得盯屏约 4 分钟·2 个必看点

橙色 = 推荐必看的 4 分钟其余读导览就够
逐段导览 · 7 段
  1. 0:17 2:10

    被低估的难题:LLM为什么搞不定表格

    开场定义问题:人类靠视觉瞬间理解表格结构,LLM则必须自行消歧布局与语义,这让电子表格成为编码智能体的盲区。

    表格对LLM的难度被系统性低估,难点在结构消歧而非计算本身

    纯口头论述铺垫问题背景,无画面依赖,适合当播客听▶ 跳到 0:17
    讲者 · Nuno Campos
  2. 2:10 5:00

    死胡同清单:多智能体与SQL/XML表示全灭

    复盘失败路径:多智能体架构、SQL、XML等所有单一表示方式均告失败;但探索留下了CSV/TSV局部视图和受HTML启发的渲染引擎两个副产品。

    失败的表示方案不是白费——它们的残留物(局部视图、渲染思路)成了后续架构的零件

    以叙事复盘为主,本章标记无值得看的画面,听讲者讲失败原因即可▶ 跳到 2:10
    讲者 · Nuno Campos
  3. 5:00 7:20

    最大突破:一个带持久状态的REPL

    把约15个工具替换为单一Node.js REPL:变量跨调用存续,一次调用组合多个操作,智能体得以在步骤间穿插推理,改造前10-15次顺序调用还常超时。

    如果你的智能体在做大量顺序工具调用,你其实是在发明一门糟糕的脚本语言

    核心论点靠口头阐述,无演示画面,但信息密度最高,值得全神贯注听完▶ 跳到 5:00
    讲者 · Nuno Campos
  4. 7:20 10:50

    自建验证闭环:公式引擎+渲染引擎

    仿照编码智能体依赖编译器/测试迭代的模式,自建公式引擎和渲染引擎作真值来源驱动自我纠错;并警告低保真引擎(只实现一半Excel公式)比没有闭环更糟。

    闭环价值取决于引擎保真度——半成品真值来源会把对的答案改错

    讲工程决策与踩坑,无现场演示,重在跟上“为什么值得自建”的论证链▶ 跳到 7:20
    讲者 · Nuno Campos
  5. 10:50 14:22

    接口会过时,闭环不会

    区分两层资产:REPL是当下最优接口,但随实验室推进计算机使用能力可能改变;四五次模型迭代表明模型越强从验证闭环中获益越多,引擎才是持久资产。

    为“会过时的接口”和“不会过时的闭环”分开投资

    战略层思辨,纯口头论述,适合边听边对照自己项目的资产分层▶ 跳到 10:50
    讲者 · Nuno Campos
  6. 14:22 16:40

    确定性评估与伪装成推理失败的bug

    用带输入输出的黄金表格做黑盒比对替代LLM打分;并指出许多“模型犯傻”实为基础设施bug:提示词错误示例被忠实遵循、工具故障导致反复重试。

    能确定性评估就别用LLM评审;细读trace分辨“模型没做对”还是“我们能修”

    涉及基准数字(50%→92%、74%跃升)大概率以幻灯片呈现,扫一眼数据页配合听讲即可▶ 跳到 14:22
    讲者 · Nuno Campos
  7. 16:40 18:48

    六条可泛化的智能体构建经验

    收束全片:REPL接口、自建闭环、确定性评估、领域知识收窄注意力等经验的提炼;强调领域知识的本质不是教概念,而是把无所不知的模型收窄到当前任务焦点。

    领域提示词在所有工具迭代中持续有效,且几乎可原样跨方案移植

    总结陈词无画面依赖,是全片最适合记笔记的部分,值得听两遍▶ 跳到 16:40
    讲者 · Nuno Campos