把「完成」从一个绿色对勾拆成可核验的对象,agent 才不会批量产出垃圾
What Does Done Even Mean? Agents and Paperclip's Liveness Model - Dotta, Paperclip · Dotta
全片 7 分钟·真正值得盯屏约 3 分钟·2 个必看点
- 0:00 – 0:55听
问题的起点:速度已经压垮验证
开场直接给出前提——agent 写代码和文档的速度,已经超过任何人类核验它的速度。继续要求人对每个任务签字,得到的不是质量保证。
当签核量超过人类带宽,签核就退化成「验证表演」,形式还在,保障已经没了。
纯口头立论,讲者对着一页极简的文字在说话,画面上没有任何多出来的信息,走路上戴耳机听不会漏。▶ 跳到 0:00讲者 · Dotta - 0:55 – 2:10听
别再把「完成」写成一个布尔值
提出核心主张:完成不是一个 true/false,而是一个打包起来的断言对象——交付了什么产物、范围多大、按什么标准、有哪些证据、谁验证、谁有权签核、还剩多少风险、下一步做什么。
给 agent 一个结构化的清单去逐项核验,而不是让它笼统地宣称「我做完了」。
这一串要素是口头逐条念出来的,跟着听比盯屏幕更容易记住次序,画面上没有值得停下来看的东西。▶ 跳到 0:55讲者 · Dotta - 2:10 – 3:25略
完成是一道阶梯,不是一个开关
把「完成」拆成层层递进的等级:生产者自称完成、评审没看出问题、证据达标、正式批准、有人为它担责、最后经受住真实世界的检验。可合并、可部署、可发布也各是不同层级的运维断言。
多数 agent 系统的毛病,是把这一整道阶梯压平成同一个绿色对勾。
这一段的分级是按列表推进的,节奏偏密。可以快速扫过并在层级切换处停一下把顺序对上,逐句精听的收益不大。▶ 跳到 2:10讲者 · Dotta - 3:25 – 4:30听
全场最硬的张力:一边是垃圾,一边是堵塞
把两个极端并排放:不设任何审批,系统一路狂奔,产出的是典型的 AI slop;全部交给人审查,则制造出没人消化得完的评审队列。两头都不通。
真正要解的不是「怎么让 agent 干得更多」,而是持续推进和可信验证之间那个必须求解的平衡。
论证密度最高的一段,靠的是讲者的推演逻辑而不是屏幕。建议原速听完不要跳,跳过任何一半结论都会站不住。▶ 跳到 3:25讲者 · Dotta - 4:30 – 5:30略
为什么一个 for 循环撑不住
反驳最常见的偷懒做法:对着任务管理器写循环去驱动 agent。一旦引入任务依赖树、阻塞关系、多个 agent 并行、幂等签出与锁,这套东西立刻崩掉。随后给出控制平面必须守住的三条底线。
三条不变量:有生产性的工作要持续推进、只有真实的阻塞才允许停工、无限循环必须有边界。
三条约束是并列关系,屏幕上大概率只是三行字。扫到条目、把三条抄下来即可,中间的展开可以加速过。▶ 跳到 4:30讲者 · Dotta - 5:30 – 6:35听
Paperclip 是怎么落地的
给出前面所有主张对应的具体实现:每个任务有明确定义的状态转移;任务之间的阻塞是一等公民,由控制平面强制执行;人工批准是交互式的并留下审计痕迹;评审人和签核人可以被显式指定。
把阻塞和签核权限做成系统强制的结构,而不是靠约定和自觉,「完成」才第一次有了可核验的形状。
是对机制的口头描述而非现场操作,屏幕没有展示实际产品界面或运行过程,听清四项机制分别解决前面哪个问题就够了。▶ 跳到 5:30讲者 · Dotta - 6:35 – 7:11听
看门狗与收尾
介绍 Watchdog(也叫 maximizer 模式):另起一个被赋予目标的 agent,负责逼着所有 agent 持续工作直到目标达成;它不绑定任何执行框架,Claude Code、Codex 都能统一用。随后收束全场。
推进力也应该是一个独立角色,而且要和具体的执行框架解耦——这决定了它能不能横跨你现有的工具链。
收尾段落节奏轻快,一句话讲完概念就进结语,没有画面需要停留,听完最后一句即可。▶ 跳到 6:35讲者 · Dotta