EN
Figma Config

波士顿动力一线视角:通用硬件如何把机器人难题变成软件问题

Designing the product that can do anything ft. Brian Ringley | Config 2026 · Megan

21 min
AgentAI 产品Evals

全片 21 分钟·真正值得盯屏约 10 分钟·3 个必看点

橙色 = 推荐必看的 10 分钟其余读导览就够
逐段导览 · 6 段
  1. 0:00 4:02

    为什么是人形:经济学突破,不是技术突破

    Figma 主持人引入后,Brian 给出核心论点:一次性投资通用硬件、之后全靠软件编程,把每个自动化应用变成软件问题;Atlas 正与 Hyundai 合作进厂,填补『值得自动化但定制硬件不划算』的边缘场景。

    人形机器人的价值在经济模型——通用硬件把机器人问题转化为软件问题

    纯口头论证商业逻辑,无关键画面,适合当播客听▶ 跳到 0:00
    讲者 · Brian Ringley
  2. 4:02 7:16

    硬件设计取舍:像机器,别像人

    三个设计决策连发:保留『面部朝向』让工人感到被注意到、动作可预测;刻意不拟人以免用户被『欺骗』;全身仅两种执行器、手臂腿部件近似互换、关节可无限旋转。

    简化与对称既压成本保可靠,还让机器人能选最高效运动路径、产生涌现行为

    此段集中了三个视觉时刻(面部朝向、非拟人外观、可反转关节),设计决策要看着机器人本体才有感▶ 跳到 4:02
    讲者 · Brian Ringley
  3. 7:16 11:44

    技能栈:强化学习走路,行为克隆干活

    运动能力靠强化学习——给动作示例后大规模仿真训练,机器人每秒 100 次预测执行器状态;灵巧操作靠行为克隆——人类专家反复示范训练出策略,每秒 30 次根据视觉和本体状态选动作。

    两条训练路径分工明确:RL 管运动,行为克隆管操作,但后者对所做之事没有语义理解

    以方法论讲解为主、配幻灯片,口头信息是主体,听懂两条路径的分工即可▶ 跳到 7:16
    讲者 · Brian Ringley
  4. 11:44 14:31

    补上语义层:一层层全是 agent

    行为克隆策略『会做』却不知道自己在做什么,于是用 VLM 把图像与语言指令语义关联、VLA 再传给行为策略执行。为采集更多示范数据,团队从熟悉的 Web 领域被推进 VR:示范者越忘记自我,数据质量越高。

    机器人没有互联网级语料,行为数据只能靠人戴 VR 头显逐一示范采集

    VR 遥操作示范(795 秒附近)是值得抽帧看的画面,『成为机器人』的状态用看的比用听的直观得多▶ 跳到 11:44
    讲者 · Brian Ringley
  5. 14:31 18:46

    无先例的 UX 难题与零成本评测

    戴上追踪手套后按不了任何按钮,而每个微小动作都在控制机器人——传统输入方式全面失效。随后是全片亮点:人头戴摄像头假扮机器人,系统提示词写好角色设定,连上自制 Web 应用就能在家测试 agent 拆解任务指令的能力。

    评测上层 agent 不需要真机也不需要仿真,一个人加一个摄像头就够了

    两个视觉时刻都在这段(871 与 956 秒),假扮机器人的评测演示是全片最值得亲眼看的画面▶ 跳到 14:31
    讲者 · Brian Ringley
  6. 18:46 21:03

    终局:工厂本身才是那个机器人

    通用平台需要上万种软件应用,对话式/agent 式软件是规模化的出路;敏捷人形机器人补缺、传统自动化做主干,由制造执行系统等高层系统统一编排异构舰队。

    人形机器人只是手段,软件定义的工厂整体才是真正的『机器人』

    收尾是愿景陈述,无演示画面,听结论即可▶ 跳到 18:46
    讲者 · Brian Ringley