波士顿动力一线视角:通用硬件如何把机器人难题变成软件问题
Designing the product that can do anything ft. Brian Ringley | Config 2026 · Megan
全片 21 分钟·真正值得盯屏约 10 分钟·3 个必看点
- 0:00 – 4:02听
为什么是人形:经济学突破,不是技术突破
Figma 主持人引入后,Brian 给出核心论点:一次性投资通用硬件、之后全靠软件编程,把每个自动化应用变成软件问题;Atlas 正与 Hyundai 合作进厂,填补『值得自动化但定制硬件不划算』的边缘场景。
人形机器人的价值在经济模型——通用硬件把机器人问题转化为软件问题
纯口头论证商业逻辑,无关键画面,适合当播客听▶ 跳到 0:00讲者 · Brian Ringley - 4:02 – 7:16看
硬件设计取舍:像机器,别像人
三个设计决策连发:保留『面部朝向』让工人感到被注意到、动作可预测;刻意不拟人以免用户被『欺骗』;全身仅两种执行器、手臂腿部件近似互换、关节可无限旋转。
简化与对称既压成本保可靠,还让机器人能选最高效运动路径、产生涌现行为
此段集中了三个视觉时刻(面部朝向、非拟人外观、可反转关节),设计决策要看着机器人本体才有感▶ 跳到 4:02讲者 · Brian Ringley - 7:16 – 11:44听
技能栈:强化学习走路,行为克隆干活
运动能力靠强化学习——给动作示例后大规模仿真训练,机器人每秒 100 次预测执行器状态;灵巧操作靠行为克隆——人类专家反复示范训练出策略,每秒 30 次根据视觉和本体状态选动作。
两条训练路径分工明确:RL 管运动,行为克隆管操作,但后者对所做之事没有语义理解
以方法论讲解为主、配幻灯片,口头信息是主体,听懂两条路径的分工即可▶ 跳到 7:16讲者 · Brian Ringley - 11:44 – 14:31看
补上语义层:一层层全是 agent
行为克隆策略『会做』却不知道自己在做什么,于是用 VLM 把图像与语言指令语义关联、VLA 再传给行为策略执行。为采集更多示范数据,团队从熟悉的 Web 领域被推进 VR:示范者越忘记自我,数据质量越高。
机器人没有互联网级语料,行为数据只能靠人戴 VR 头显逐一示范采集
VR 遥操作示范(795 秒附近)是值得抽帧看的画面,『成为机器人』的状态用看的比用听的直观得多▶ 跳到 11:44讲者 · Brian Ringley - 14:31 – 18:46看
无先例的 UX 难题与零成本评测
戴上追踪手套后按不了任何按钮,而每个微小动作都在控制机器人——传统输入方式全面失效。随后是全片亮点:人头戴摄像头假扮机器人,系统提示词写好角色设定,连上自制 Web 应用就能在家测试 agent 拆解任务指令的能力。
评测上层 agent 不需要真机也不需要仿真,一个人加一个摄像头就够了
两个视觉时刻都在这段(871 与 956 秒),假扮机器人的评测演示是全片最值得亲眼看的画面▶ 跳到 14:31讲者 · Brian Ringley - 18:46 – 21:03听
终局:工厂本身才是那个机器人
通用平台需要上万种软件应用,对话式/agent 式软件是规模化的出路;敏捷人形机器人补缺、传统自动化做主干,由制造执行系统等高层系统统一编排异构舰队。
人形机器人只是手段,软件定义的工厂整体才是真正的『机器人』
收尾是愿景陈述,无演示画面,听结论即可▶ 跳到 18:46讲者 · Brian Ringley