编码代理不缺智商,缺可靠性——用递归分解把偶发高光变成可复现结果。
Recursive Coding Agents - Raymond Weitekamp, OpenProse · Raymond Weitekamp
全片 24 分钟·真正值得盯屏约 7 分钟·2 个必看点
- 0:00 – 3:10听
被错误管理的天才
开场先摆问题:编码代理不是不够聪明,而是不可靠。同一个工具一天能写出接近完整的 SaaS 应用,另一天却清空了讲者本人的 Solana 钱包。
信任的本质是方差可控,不是能力上限;下一步该补的是编排层,不是原始智能。
全程是讲者在讲自己的踩坑经历,屏幕基本停在标题页,通勤路上戴耳机听完就够。▶ 跳到 0:00讲者 · Raymond Weitekamp - 3:10 – 7:04听
把上下文变成能操作的东西
解释递归语言模型的核心机制:完整 prompt 被外部化成一个变量,代理在可执行环境里对它做符号操作,并自己决定怎么切分成子调用再汇总。
判定标准只有一条——分解方式必须由模型自己决定,写死的 mapreduce 不算。
这一段是概念推导,讲者靠口头层层递进地把定义讲透,配图起不到额外作用,专心听思路即可。▶ 跳到 3:10讲者 · Raymond Weitekamp - 7:04 – 11:00略
小模型打赢顶级模型
亮出一批基准成绩:能吞下超出上下文窗口好几个数量级的信息,默认框架未经改动就接近记忆系统前十,长推理任务上 Qwen 3.5-9B 打赢了 Opus 这一档的模型。
这类难题卡住顶级模型的原因是推理步数太多、思路维持不住,而不是单步不够聪明。
屏幕上是一连串成绩对比表和排行榜截图,扫一眼数字量级和模型名称就抓住重点,逐行细读没必要。▶ 跳到 7:04讲者 · Raymond Weitekamp - 11:00 – 14:06听
把评测圈搅乱了
讲成绩带来的连锁反应:Symbolica 的框架在 Arc AGI 3 发布几小时内拿到 30% 以上(前沿模型只有 2–3%),却被 Arc Prize 团队拒绝完整私有评估;长推理榜的维护者也被迫另开一个「开放框架」分榜。
现有评测体系默认「不许调工具」,而递归代理正好踩在这条线上,成绩越好越难被承认。
这段讲的是社区里的来龙去脉和几方态度,靠叙述推进,画面只是零星几张成绩截图,听着就能跟上。▶ 跳到 11:00讲者 · Raymond Weitekamp - 14:06 – 17:30看
编码代理跨过那条线
盘点生态里的几种实现(DSP.rlm、YPI、Axe、Unix RLM),并说明 Claude Code 是怎么随着动态工作流的发布,从「不算」变成「可以说算」的。
别纠结定义之争,该问的是怎么把递归分解的原则用到手头的代理上。
讲者一边说一边在屏幕上对照几个项目,还指向右侧那条来自论文作者的公开回应;他讲到「这边」的时候画面上正有东西被指,不看会丢掉半句话。▶ 跳到 14:06讲者 · Raymond Weitekamp - 17:30 – 21:07看
OpenPros 怎么用
介绍 OpenPros:一门由编码代理而不是编译器来执行的语言,用 markdown 和逻辑英语书写,没有语法要学。它能显式声明子代理各干什么、在父会话里验收子代理的产出,还能把技能和命令行工具接线给指定的子代理。
只要一个代理有文件系统和子代理,写一份规范就能把它变成递归代理,能力配置也一并写进契约。
规范文件的实际写法和子代理接线关系全在屏幕上,这类结构看一眼胜过听三遍描述,建议开着画面跟。▶ 跳到 17:30讲者 · Raymond Weitekamp - 21:07 – 23:46听
把高光那次固化下来
收尾给出落地场景:仓库级大规模迁移的并行重构再合并、递归式深度调研、审计与 bug 扫查、红队式对抗改进,重点落在「黄金会话复用」。
把一次表现极好的会话拆解成可重复执行的递归流程,运气才变成能交付的结果。
结尾是场景罗列和观点收束,讲者语速平稳、没有需要盯屏的细节,听完正好带走全场结论。▶ 跳到 21:07讲者 · Raymond Weitekamp