500 美元、21 小时 RL 训练,4B 模型工具调用打赢 235B
Stop Making Models Bigger, Make Them Behave — Kobie Crawford, Snorkel · Kobie Crawford
全片 21 分钟·真正值得盯屏约 6 分钟·2 个必看点
- 0:16 – 4:55听
为什么不该一味把模型做大
讲者交代研究动机:业界遇到效果不达标就换更大模型的默认反应,未必是对的答案。同时给出企业选小模型的现实理由——成本、速度、安全,以及金融医疗对本地部署和数据不出境的合规要求。
企业生产用例和个人助手不是一回事,它需要一个被约束住的实现方式,而不是更大的参数量。
这段基本是讲者站着说观点和行业背景,画面没有额外信息,通勤路上当播客听就够。▶ 跳到 0:16讲者 · Kobie Crawford - 4:55 – 7:36听
真正的瓶颈是工具使用纪律
把失败重新归因:模型答错金融分析题,往往不是推理能力不够,而是不肯先探查环境、不检查手上有哪些工具可用。讲者在这里立起全场的核心判断。
分清「不会想」和「不守规矩」,是决定该换大模型还是该做 RL 训练的分水岭。
纯口头论述,讲者在铺垫下一段要放的证据,听清逻辑即可,不必盯屏幕。▶ 跳到 4:55讲者 · Kobie Crawford - 7:36 – 9:01看
235B 模型的翻车现场
现场走查 Qwen-3 235B 回答 YouTube 广告收入 2023 到 2024 年同比增长的执行轨迹:不先查可用表就直接查询不存在的表,连续两次落空后编造了答案。
拥有工具不等于会用工具——它明明可以先列出表名,却一次都没调用。
整段的信息都在屏幕上那串一步步走错的调用记录里,讲者只是在旁边点评,不看画面就等于错过了证据本身。▶ 跳到 7:36讲者 · Kobie Crawford - 9:01 – 12:09听
怎么做的:专家把关的数据 + 低成本训练
介绍 Snorkel 与 UC Berkeley Agentica 的做法:数据由领域专家在环把关,并要求每条题目都存在可查询验证的标准答案;训练用 GRPO,整个作业 21 小时跑完、单次成本不到 500 美元。
答案可验证是这类 RL 数据集能不能开工的前提,比数据量更关键。
方法论描述为主,讲者在讲流程和取舍,配的页面只是提纲,听着走一遍思路就行。▶ 跳到 9:01讲者 · Kobie Crawford - 12:09 – 15:06略
结果:4B 反超 235B,pass@1 接近翻倍
公布主结果并展示基准对比:训练后的 4B 模型在金融工具调用任务上 pass@1 接近翻倍并超过 235B 模型。讲者顺带带过配套的 FinQa 环境——自包含、无外部依赖,内置 290 条和 79 条两个基准,已在 Prime Intellect、OpenEnv 仓库和 HF Spaces 公开。
参数量差近六十倍仍被反超,说明这类任务的天花板压根不在模型规模上。
这一段的干货集中在几张成绩对比表和资源清单上,暂停截图记下数字和仓库位置,比逐句听讲更省时间。▶ 跳到 12:09讲者 · Kobie Crawford - 15:06 – 19:11看
行为对比与反直觉的消融结论
并排展示 4B 模型的正确解题过程——先列表名、再看字段结构、写 SQL 报错后读错误信息改掉列名。随后给出消融实验:只用单表数据训练带来的提升最大,而且能迁移到更难的多表推理基准,成绩从 13.9% 提升到 26.6%。
工具发现和错误自纠这两个动作,才是解题的真正胜负手;训练数据也不是越复杂越好。
前半段的价值全在那条完整的执行轨迹上,尤其是报错后自己改列名那几步;后半段的消融数字建议顺手截下来,是全场最容易被误判的结论。▶ 跳到 15:06讲者 · Kobie Crawford - 19:11 – 20:34听
收尾:评分细则用来选数据,RL 只吃标量
讲者交代实践中的分工:用 rubric 的丰富反馈去分析模型欠缺哪些行为、据此决定数据选型,而 RL 循环本身仍然按 GRPO 只用单一标量奖励。最后指向 Snorkel 官方博客,那篇文里还链着 Agentica 团队的伙伴文章。
细颗粒度的反馈用在数据决策环节,不要硬塞进奖励函数里。
收尾的经验之谈,画面只有一个链接页;把博客地址记下来之后,剩下的听完就行。▶ 跳到 19:11讲者 · Kobie Crawford