EN
AI Engineer World's Fair

OpenAI Codex 团队拆解:从盯十个终端窗口,到只跟一个长驻经理 agent 对话

The Golden Age of AI Engineering — Alexander Embiricos & Romain Huet & Peter Steinberger, OpenAI · Romain Huet

25 min
AgentAI 编程AI 产品Context

全片 25 分钟·真正值得盯屏约 5 分钟·2 个必看点

橙色 = 推荐必看的 5 分钟其余读导览就够
逐段导览 · 7 段
  1. 0:13 3:45

    从代码补全到自主长任务

    Romain Huet 开场梳理 AI 编码这几年的演进路线:从补全几行代码,一路走到能独立跑完长任务的 agent。顺带交代了模型发布节奏的变化——周期从大约十五个月压缩到六周左右。

    真正的变量不是模型某一次变强,而是变强的频率——按六周一档的节奏,你去年为规避模型缺陷搭的工程约束,今年多半已经是负债。

    这一段基本是讲者站着口述行业脉络,屏幕上没有需要盯的东西,通勤或做别的事时听着就行。▶ 跳到 0:13
    讲者 · Romain Huet
  2. 3:45 7:14

    现场演示:模型自己验证自己

    台上做实机演示,让模型直接操控会场的摄像与灯光系统,并展示它已经能自己跑代码、自测结果。讲者用 2024 年那次只能靠运气的演示做对照。

    「能自己执行并验证结果」是分水岭:从这一步开始,人不必再逐行旁观,才谈得上把任务整包交出去。

    全场少数真刀真枪的实机环节,设备的实际反应就是论据本身,转成文字会丢掉大半说服力,值得停下来看完整。▶ 跳到 3:45
    讲者 · Romain Huet
  3. 7:14 12:25

    把 agent 当团队带,而不是当工具用

    提出核心心智模型:与 agent 协作更像带一支团队——大多数时候用对话派活,只在棘手处才深入细节结对。并顺势批评了现有产品形态:命令行撑不起面向任意工作的协作界面,而 IDE 的顺序是反的。

    正确的交互顺序是先聊清楚要什么、需要时再下沉到代码;先打开代码文件再聊,等于一开始就把自己钉死在实现细节上。

    纯观点论述,讲者主要在讲道理而不是演示界面,听清楚推理链条比看屏幕重要。▶ 跳到 7:14
    讲者 · Romain Huet
  4. 12:25 14:08

    Codex 的开放分层

    展示 Codex 被刻意拆成的几层:harness 开源、可以 fork、可以换成开源模型复用同一套 agent 循环;OpenAI 自家产品也走同样开源的 App Server;Codex 自己需要的新能力优先沉淀进对外的同一套 API。屏幕上同时展开了内嵌浏览器与插件。

    「我们用的和你们用的是同一套原语」不是姿态而是设计约束——它决定了你能不能在同一层上接着搭自己的 agent 系统。

    分层关系和产品界面都在大屏上,看一眼能省掉一整段口头解释;这也是全片信息密度最高的画面之一。▶ 跳到 12:25
    讲者 · Romain Huet
  5. 14:14 18:42

    成本、速度与云端执行

    Alexander Embiricos 用一组数字说明性价比进展:GPT-5.6 Terra 以约一半成本给出上一代水准的智能,Luna 定价每百万 token 一美元输入、六美元输出仍在评测中胜过多款知名模型,Sol 在 Cerebras 上跑到每秒约 750 token。并提出衡量标准应是把价值最大化,而非把 token 用满。

    速度的意义不是早几秒拿到答案,而是让 agent 并行试五六种方案再挑最好的——这条路径过去在成本上不成立,现在成立了。

    这一段主要是定价表和跑分对照,屏幕上是静态数字。暂停截个图记下几个关键数,比顺着听一遍更省时间。▶ 跳到 14:14
    讲者 · Alexander Embiricos
  6. 18:50 22:05

    别再当人肉调度器

    Peter Steinberger 直指现状:同时盯十个终端窗口,人实际上退化成了调度器和记忆体。替代方案是只与一个长驻经理 agent 对话,由它委派 worker 团队。他给出这套模式成立的三个前提——服务端 compaction 让长任务可靠、协调能力让一个线程带多个项目、以及自动化触发器。

    瓶颈已经从 token、从本地算力,迁移到了注意力——而注意力无法增发,所以当下最值钱的技能是决定把它花在哪。

    全场最锋利的一段,靠的是论证和真实使用体感,画面上只有讲者本人。适合闭眼听、边听边对照自己的工作方式。▶ 跳到 18:50
    讲者 · Peter Steinberger
  7. 22:08 24:56

    内外双循环:人只做决策

    收尾给出完整闭环形态:issue 提交后经理 agent 评估、worker 实现并跑测试、另一个 agent 评审,人只需审阅一次附带 diff 和录屏的 PR。落点是——编码被抽象掉不等于工程师消亡,工程的本质是解决问题。

    模型的进步已经跑在 harness 和团队组织形态前面,设计人与 agent 的协作循环本身,就是下一个真正的工程问题。

    结论段,讲者口头收束全场论点,没有新的演示或图表,听完最后这几分钟就能拿到完整立场。▶ 跳到 22:08
    讲者 · Peter Steinberger