碳核算没有标准答案,他把智能体的验证从答案挪到了过程
Respect The Process - Andrew Dumit, Watershed Technology Inc. · Andrew Dumit
全片 17 分钟·真正值得盯屏约 6 分钟·3 个必看点
- 0:00 – 2:25听
同一瓶葡萄酒,六位专家算出 50% 的差距
开场抛出 2020 年的一项研究:六位专家拿着同一瓶葡萄酒的同一份数据,算出的碳排放结果相差高达五成。由此引出整场的问题意识——当领域本身就没有唯一答案时,你没法靠比对最终结果来判断系统对不对。
在专家意见本就合理分歧的领域,「答案正确」不是一个可用的验收标准,评估基准本身也只是合理区间里的一个点。
这一段是纯口头铺陈论点,屏幕基本停在标题和研究结论上,边做别的事听完就够。▶ 跳到 0:00讲者 · Andrew Dumit - 2:25 – 4:25略
任务对象:一件商品一张图,几千个节点
介绍要交给智能体的活儿到底长什么样:每个产品对应一张完整供应链图,以一条深色水洗牛仔裤为例,面料、辅料、能源、运输、包装各成一条流,节点数以千计且都挂着丰富元数据。
任务不是回答问题,而是在一张结构复杂、字段互相牵连的大图上做批量编辑。
牛仔裤那张图值得停下来扫一眼,看清分支的宽度和节点密度;具体节点名不必细读,感受规模即可。▶ 跳到 2:25讲者 · Andrew Dumit - 4:25 – 7:04听
专用工具在规模上崩掉,于是换成编码智能体
先讲为智能体做高度特化图操作工具的老路:单张图还行,扩到几十上百张、几十万节点就全面失效——策略前后不一致、整张图被漏掉、探索本身成为瓶颈、上下文烧完后开始编造字段结构继而反复重试出错。换成编码智能体后能力大涨:会创造性地绕路解题,能像做数据分析一样批量探索和修改,灵活性远超原本的设计意图;代价是无约束的代码执行很危险,它会为达成目标找任何一条路,包括碰不该碰的资源。
收益和风险来自同一件事——放开手写代码,所以问题不是要不要放开,而是把约束加在哪一层。
这段是失败复盘加权衡论述,画面只是要点罗列,跟着讲述走就行。▶ 跳到 4:25讲者 · Andrew Dumit - 7:04 – 9:20看
核心架构:唯一修改入口,执行权不交出去
给出全场的主答案。智能体想怎么推理、怎么写代码都不干涉,但凡是会改动图的代码,必须经过一套类型化的 SDK——它区分哪些字段可编辑、哪些是派生出来的,能被静态检查出错。最后一步执行由平台自己跑,产出可提交的类型化编辑对象,因此全程有效、可追溯、可重放,失败就打回重来。
约束的是效果,不是表达方式:模型的推理能力一分不减,被卡死的只是它能对数据做什么。
架构分层全靠那张图撑着——哪一层自由、哪一层收口、执行的手在谁那边,图上一目了然,光听容易把层次听混。▶ 跳到 7:04讲者 · Andrew Dumit - 9:20 – 11:40略
怎么把自家 SDK 教会智能体
讲落地细节:教智能体用你的 SDK,和教它在你的代码库里写代码是同一套办法——提示词里说清用法,同时把文档和底层实现都开放给它查;SDK 内部还内置断言,让写错的代码尽早炸掉而不是悄悄跑出错误结果。此外还有技能库与少量示例教学、改善工具本身的易用性、用规划-执行循环拆任务、把领域专家的判断显式写出来教给它。
架构再新,界定任务用的还是那套常规上下文和提示工程,一样不能省。
屏幕上是罗列型的要点和代码示意,节奏偏快;扫一眼断言那部分的写法,其余听过即可。▶ 跳到 9:20讲者 · Andrew Dumit - 11:40 – 14:08看
结果长这样:一份能层层下钻的评审报告
展示确定性执行最终吐出来的东西——一份结构化的评审报告,不用读一行底层代码就能看懂智能体干了什么:某个编辑函数作用于 50 张图、产生 749 个编辑动作、整体减排 45.6%,还能继续下钻到单个函数、单张图乃至节点级的具体改动。
有了这层可审阅的产出,智能体的创造力从风险变成了被安全边界圈住的优势。
报告的信息层级是这段的全部说服力所在——从总量数字一路点进单个节点的过程要看画面才有体感,只听数字会以为不过是几行日志。▶ 跳到 11:40讲者 · Andrew Dumit - 14:08 – 16:42听
收尾三原则:尊重过程
把方法论收成三条可迁移的原则:给智能体界定良好的原语而不是随便操作的代码;平台必须完全掌控最后的执行,防止智能体用你没想到的方式「宣布自己成功了」;用确定性的产出生成连非程序员都能校验的结果——写代码只是手段,不是目的。
「尊重过程」的意思是:既然验不了答案,就把保证建立在产生答案的那条路径上。
结尾是三句话的原则复述,画面只有一页要点,闭眼听完正好。▶ 跳到 14:08讲者 · Andrew Dumit