EN
AI Engineer World's Fair

Prime Intellect 创始人亲拆开源 RL 全栈:5 万美元完成前沿模型全量 RL 的真实成本账

Building Open Source Agentic Models — Will Brown, Prime Intellect · Will Brown

47 min
AgentEvalsAI 编程

全片 46 分钟·真正值得盯屏约 15 分钟·3 个必看点

橙色 = 推荐必看的 15 分钟其余读导览就够
逐段导览 · 7 段
  1. 0:13 7:15

    开放超级智能栈全景

    Will Brown 介绍 Prime Intellect 的定位与全栈:万卡级 GPU 算力市场、PRIME-RL 训练框架、Verifiers 环境体系与 Environments Hub。

    开源 agentic 模型训练是一条从算力到环境的完整纵向栈,而非单一框架。

    180s 附近有一张自下而上的技术栈总览图值得停一下,其余为口头铺垫,快速过即可。▶ 跳到 0:13
    讲者 · Will Brown
  2. 7:15 14:18

    评估飞轮与环境抽象

    提出环境(environment)是 post-training 的统一基础设施单元:同一套 rollout+验证流程同时服务离线评估、RL 训练和 SFT 数据生成。

    SFT 与 on-policy distillation 都可建模为“带 teacher 的环境 rollout”,只是打分来源不同。

    本段是纯概念论述、无关键画面,适合听讲者建立全片的核心心智模型。▶ 跳到 7:15
    讲者 · Will Brown
  3. 14:18 21:20

    Verifiers V1:任务与 Harness 分层

    讲解 Verifiers V1 把环境重构为任务(task)与 harness 两个独立概念,以支持 Codex、Claude Code 等 CLI agent 及自建 harness,并讨论组奖励设计。

    旧的“单一循环插工具”模式适配不了 CLI agent 与 MCP 等新形态,任务/harness 解耦是 V1 的核心动机。

    以 API 设计取舍的口头阐述为主,无演示画面,重在跟上概念拆分的理由。▶ 跳到 14:18
    讲者 · Will Brown
  4. 21:20 28:21

    Trace 与 Renderers:分词陷阱

    剖析 tokenizer 多对一、Jinja 聊天模板悄悄剥换行符等隐蔽正确性陷阱,并介绍新库 Renderers 如何维护消息与 token 的严格双向映射。

    分词与聊天模板不一致会让训练器与推理引擎悄悄跑偏,是 RL 训练中最隐蔽的 bug 来源。

    属于工程细节的口头警示与方案说明,没有必须盯着看的画面,听重点即可。▶ 跳到 21:20
    讲者 · Will Brown
  5. 28:21 35:26

    PRIME-RL 异步架构与成本账

    解释为何 agent 场景应放弃完全同策(长尾 rollout 拖慢整个 batch),介绍客户端-服务器彻底解耦的全异步架构,并给出 GLM-5 千步全量 RL 约 3 天 5 万美元的实测成本。

    5 万美元与不少企业一个月的 token 开销同量级——大规模 post-training 对普通企业开始经济可行。

    全片价值密度最高的一段,架构解耦与成本数字环环相扣,值得完整专注地看完。▶ 跳到 28:21
    讲者 · Will Brown
  6. 35:26 42:26

    系统优化与算法解耦

    讲 PRIME-RL 如何把“损失求梯度”与“算法准备数据”解耦(新算法≈写一个赋 advantage 的函数),以及选 Torch Titan 而非 Megatran 的 hackable 逻辑。

    当下是“研究的时代”,框架 hackable 让不到 10 人的团队能并行推进新算法。

    论述为主,但 2512s 处有一张把各类 post-training 算法归入统一坐标系的图,值得专门停下看。▶ 跳到 35:26
    讲者 · Will Brown
  7. 42:26 46:29

    托管训练平台与收尾

    介绍托管训练平台:多租户 LoRA 与多租户推理同构、按 token 计费、笔记本上开发环境再推送到平台,最后是团队招募。

    推荐工作流是把环境迭代与训练基础设施彻底分离——本地开发环境,云端按 token 训练。

    产品形态与路线图的口头介绍,无演示,按需听结尾的工作流建议即可。▶ 跳到 42:26
    讲者 · Will Brown