EN
AI Engineer World's Fair

只改一段界面文案,就让审核员的否决率涨了21个百分点

Build AI Systems for Discernment, Not Approval - Angel Ortmann Lee, Duolingo · Angel Ortmann Lee

26 min
AI 产品EvalsAgentAI 编程

全片 26 分钟·真正值得盯屏约 11 分钟·3 个必看点

橙色 = 推荐必看的 11 分钟其余读导览就够
逐段导览 · 8 段
  1. 0:00 3:10

    开场:我们信任 AI 的方式变了

    讲者以 Duolingo 英语测试的监考体系开场,抛出全场命题:当 AI 越来越多地嵌进日常决策,人给出的不再是判断,而是盖章。

    问题的靶子不是模型准不准,而是人在 AI 面前还愿不愿意动脑

    这一段基本是讲者站着讲观点,屏幕只有标题页,戴上耳机走路听完全不损失信息▶ 跳到 0:00
    讲者 · Angel Ortmann Lee
  2. 3:10 7:04

    认知投降:一组扎心的数字

    引用沃顿商学院的研究给『认知投降』定量:AI 答对时人的成绩提升 25 个百分点,AI 答错时反而下降 15 个百分点,而且八成参与者在 AI 给出错误答案时照单全收。

    人对 AI 的信任上升和审慎下降是同一件事的两面,AI 一旦出错,人不但拦不住还会被带偏

    数字都由讲者口头念出,画面没有可看的实物或演示,听觉获取效率最高▶ 跳到 3:10
    讲者 · Angel Ortmann Lee
  3. 7:04 9:30

    伪造警报实验:一段文案换来 21 个百分点

    团队把编造的『抄写打字』AI 信号混进真实监考流程,结果训练有素的审核员大批直接放行。排查后发现模型误报率只有 1%,人也没偷懒,症结在界面;只把指南文案改成『AI 提示只是初步警报,维持标记必须有视频独立证据』,否决率就从 50% 升到 71%。

    模型没改、界面布局没改,只换了一句提示语,人的判断质量就变了——这是全场最硬的一块证据

    改动前后的两版文案会并排打在屏幕上,只听讲很难体会那句话的措辞差别有多小、效果有多大,值得停下来把两段字读一遍▶ 跳到 7:04
    讲者 · Angel Ortmann Lee
  4. 9:30 12:08

    人机回环其实是个圈

    纠正一个普遍误解:人机回环不是『模型输出→人审核→做决定』的直线,而是闭环——界面塑造人的行为,人的行为变成评估和训练数据,再喂回下一代模型。

    界面不逼人思考就会滚成恶性循环:盖章放行→假阳性进数据集→模型更自信→人更顺从

    这里主要靠一张循环示意图撑起论证,把图看清方向和箭头就够了,讲解部分可以加速过▶ 跳到 9:30
    讲者 · Angel Ortmann Lee
  5. 12:08 14:07

    耳机案例:一个按钮里藏了两个问题

    拆解监考界面的『检测到耳机』确认按钮:它同时在问『模型看对了吗』和『这该不该算违规』。戴助听器的考生会让两个答案完全相反,于是团队把它拆成两问。

    把感知判断和政策判断塞进同一个按钮,等于逼人二选一,代价是考生被冤枉、模型被喂错标签

    改造前后的两版按钮直接摆在屏幕上对比,一眼能看出多出来的那一问长什么样,这是全场最容易照搬到自家产品的一屏▶ 跳到 12:08
    讲者 · Angel Ortmann Lee
  6. 14:07 16:05

    写作导师:把反馈钉到具体句子上

    用『请朋友帮忙看看我写的东西』作类比,展示写作导师的做法:不给整段评语,而是把绿黄红三色标注直接压在原文上,悬停出现一句可执行建议,可以当场采纳。

    同一份模型输出,锚定到具体文本就能触发逐句思考,堆成一整段就只会被人一眼扫过

    彩色标注、悬停提示、就地采纳这几个交互全靠画面呈现,只听讲述完全想象不出那种批注体验▶ 跳到 14:07
    讲者 · Angel Ortmann Lee
  7. 16:05 21:12

    编码智能体的两种坏做法

    点名两个反面模式:一次性甩出巨型改动让人回头去代码托管平台慢慢翻,或者每改一行就弹窗要确认。两者都把开发者变成橡皮图章,只能收到偏向『同意』的低信息量点击。理想形态应该像一个优秀的初级开发者:会做计划、会提好问题、会记录设计取舍、会把改动拆成能审的粒度。

    衡量协作质量的不是确认了多少次,而是系统有没有从你的追问和修改里学到东西

    配图是几张代码审查流程的示意,信息密度不高,论点靠讲述推进,扫一眼图跟着听即可▶ 跳到 16:05
    讲者 · Angel Ortmann Lee
  8. 21:12 25:52

    收束:每一次交互本身就是标签

    落到最实用的一条:计划被批准、建议被采纳就是正样本,被改写或推翻就是负样本,根本不用另外雇人标注。但绝大多数系统漏掉了最关键的信号——用户点了『同意』之后又手动改掉输出,那个改动差异从没被记录,于是污染数据的假阳性堂而皇之进了库。最后收在方法论:先想清楚要激发什么样的思考,把人从验证者重构成调查者。

    去量化『用户嘴上说同意、手上却改掉了什么』,这个差值是最诚实也最被忽视的训练信号

    结尾会展开一屏用户提问的实际样本,讲者逐条点出这些问题的情绪和倾向说明了什么,画面上的原话是论证的一部分,跳过就只剩结论▶ 跳到 21:12
    讲者 · Angel Ortmann Lee