EN
AI Engineer World's Fair

500 美元、21 小时 RL 训练,4B 模型工具调用打赢 235B

Stop Making Models Bigger, Make Them Behave — Kobie Crawford, Snorkel · Kobie Crawford

21 min
AgentEvals

全片 21 分钟·真正值得盯屏约 6 分钟·2 个必看点

橙色 = 推荐必看的 6 分钟其余读导览就够
逐段导览 · 7 段
  1. 0:16 4:55

    为什么不该一味把模型做大

    讲者交代研究动机:业界遇到效果不达标就换更大模型的默认反应,未必是对的答案。同时给出企业选小模型的现实理由——成本、速度、安全,以及金融医疗对本地部署和数据不出境的合规要求。

    企业生产用例和个人助手不是一回事,它需要一个被约束住的实现方式,而不是更大的参数量。

    这段基本是讲者站着说观点和行业背景,画面没有额外信息,通勤路上当播客听就够。▶ 跳到 0:16
    讲者 · Kobie Crawford
  2. 4:55 7:36

    真正的瓶颈是工具使用纪律

    把失败重新归因:模型答错金融分析题,往往不是推理能力不够,而是不肯先探查环境、不检查手上有哪些工具可用。讲者在这里立起全场的核心判断。

    分清「不会想」和「不守规矩」,是决定该换大模型还是该做 RL 训练的分水岭。

    纯口头论述,讲者在铺垫下一段要放的证据,听清逻辑即可,不必盯屏幕。▶ 跳到 4:55
    讲者 · Kobie Crawford
  3. 7:36 9:01

    235B 模型的翻车现场

    现场走查 Qwen-3 235B 回答 YouTube 广告收入 2023 到 2024 年同比增长的执行轨迹:不先查可用表就直接查询不存在的表,连续两次落空后编造了答案。

    拥有工具不等于会用工具——它明明可以先列出表名,却一次都没调用。

    整段的信息都在屏幕上那串一步步走错的调用记录里,讲者只是在旁边点评,不看画面就等于错过了证据本身。▶ 跳到 7:36
    讲者 · Kobie Crawford
  4. 9:01 12:09

    怎么做的:专家把关的数据 + 低成本训练

    介绍 Snorkel 与 UC Berkeley Agentica 的做法:数据由领域专家在环把关,并要求每条题目都存在可查询验证的标准答案;训练用 GRPO,整个作业 21 小时跑完、单次成本不到 500 美元。

    答案可验证是这类 RL 数据集能不能开工的前提,比数据量更关键。

    方法论描述为主,讲者在讲流程和取舍,配的页面只是提纲,听着走一遍思路就行。▶ 跳到 9:01
    讲者 · Kobie Crawford
  5. 12:09 15:06

    结果:4B 反超 235B,pass@1 接近翻倍

    公布主结果并展示基准对比:训练后的 4B 模型在金融工具调用任务上 pass@1 接近翻倍并超过 235B 模型。讲者顺带带过配套的 FinQa 环境——自包含、无外部依赖,内置 290 条和 79 条两个基准,已在 Prime Intellect、OpenEnv 仓库和 HF Spaces 公开。

    参数量差近六十倍仍被反超,说明这类任务的天花板压根不在模型规模上。

    这一段的干货集中在几张成绩对比表和资源清单上,暂停截图记下数字和仓库位置,比逐句听讲更省时间。▶ 跳到 12:09
    讲者 · Kobie Crawford
  6. 15:06 19:11

    行为对比与反直觉的消融结论

    并排展示 4B 模型的正确解题过程——先列表名、再看字段结构、写 SQL 报错后读错误信息改掉列名。随后给出消融实验:只用单表数据训练带来的提升最大,而且能迁移到更难的多表推理基准,成绩从 13.9% 提升到 26.6%。

    工具发现和错误自纠这两个动作,才是解题的真正胜负手;训练数据也不是越复杂越好。

    前半段的价值全在那条完整的执行轨迹上,尤其是报错后自己改列名那几步;后半段的消融数字建议顺手截下来,是全场最容易被误判的结论。▶ 跳到 15:06
    讲者 · Kobie Crawford
  7. 19:11 20:34

    收尾:评分细则用来选数据,RL 只吃标量

    讲者交代实践中的分工:用 rubric 的丰富反馈去分析模型欠缺哪些行为、据此决定数据选型,而 RL 循环本身仍然按 GRPO 只用单一标量奖励。最后指向 Snorkel 官方博客,那篇文里还链着 Agentica 团队的伙伴文章。

    细颗粒度的反馈用在数据决策环节,不要硬塞进奖励函数里。

    收尾的经验之谈,画面只有一个链接页;把博客地址记下来之后,剩下的听完就行。▶ 跳到 19:11
    讲者 · Kobie Crawford