EN
AI Engineer World's Fair

一个可复现实验证明:你的角色AI评测,测不出汉密尔顿“读过自己的音乐剧”

The Miranda Hypothesis: How Hamilton Poisoned Persona Evals - Jacob E. Thomas, Results Gen · Jacob E. Thomas

58 min
EvalsContextAI 产品Agent

全片 58 分钟·真正值得盯屏约 25 分钟·3 个必看点

橙色 = 推荐必看的 25 分钟其余读导览就够
逐段导览 · 8 段
  1. 0:05 8:17

    开场演示与三个范式阶段

    先展示角色扮演语言代理的规模化现实与开源框架Companion,现场让林肯回答战争权问题得到“貌似正确”的答案;随后梳理领域已有的三个范式阶段,抛出核心论题。

    记住这个林肯答案里的“固有行政权力”——它听起来像林肯,但整场演讲将证明它是二十世纪的概念。

    148s起是现场实例化演示,是全片最重要的伏笔,需要亲眼看到那个“流畅而可信”的输出才能体会后面的拆解力度。▶ 跳到 0:05
    讲者 · Jacob E. Thomas
  2. 8:22 17:49

    面具与镜子:米兰达假说登场

    论证“令人信服”与“忠实”是独立属性,现有评测(如InCharacter的80.7%)只测前者;并置模型汉密尔顿与文献汉密尔顿,提出米兰达假说:文化主导表征系统性覆写一手文献。

    人格一致性满分的汉密尔顿,可以同时“读过自己的百老汇音乐剧”——评测在结构上无法检测这种主导失效。

    本段有值得看的画面:675s的实证并置需要看两段文本的具体措辞差异(情感叙事弧 vs 法条化句法),听是听不出来的。▶ 跳到 8:22
    讲者 · Jacob E. Thomas
  3. 17:55 21:59

    证据与机制:为什么对齐反而放大失真

    用Schuyler宅邸讲解员“反教音乐剧”的人类实证,说明语料失衡如何压倒文献;并论证偏好优化因标注者也被同一文化叙事塑造而奖励神话化输出,时间锁定语料同样救不了。

    对齐不是修复而是“算法性谄媚”:修复必须发生在“相遇”处,而非语料基底。

    本段是纯口头论述与轶事证据,无画面依赖,通勤听即可。▶ 跳到 17:55
    讲者 · Jacob E. Thomas
  4. 22:06 33:38

    第四范式:认识论模拟及其架构抉择

    提出“认识论模拟”:人格是配置而非模型属性,由提示、一手文献、时间锚、现成模型、持解释监护权的人组成;并给出反直觉结论——对人格保真,微调比上下文注入更糟。

    “你不训练人格,你组装一次相遇,并保留凭据”——上下文窗口可审计、可回滚,且是人人可用的“厨房餐桌能力”。

    三个章节均无视觉依赖,是全片论证密度最高的口头部分,适合专注听;概念多,可配合倍速回放。▶ 跳到 22:06
    讲者 · Jacob E. Thomas
  5. 33:46 40:39

    棱镜实验:预注册的林肯四时刻设计

    以棱镜为概念模型(白光=合成人格,棱镜=语料+时间锚,光谱=分开保持的多个自我),给出4个历史时刻×3种播种条件(一手文献/传记/裸模型)的实验矩阵。

    C3裸模型是“无棱镜的白光”,充当米兰达失真的对照基线;全部预测在采集数据前预注册并盖时间戳。

    棱镜示意与实验矩阵是幻灯片图表,扫一眼矩阵结构即可跟上,不必逐秒盯看。▶ 跳到 33:46
    讲者 · Jacob E. Thomas
  6. 40:43 47:36

    评分规约与单格解剖(全片高潮)

    评分规约刻意剔除“听起来像不像”并把时代错置权重压到40%;随后回扣开场演示:那个林肯答案正是C3×1847格的输出,与1848年林肯致Herndon的真实信件逐项对照打分。

    “朴素而忠实”必须压过“流畅而时代错置”——把声音设为评分轴,恰是去奖励仪器本要捕捉的错误。

    本段视觉依赖强:有斯皮尔伯格《林肯》片段、真实信件原文、以及观测结果与预注册预测分栏的评分格,画面本身就是证据链。▶ 跳到 40:43
    讲者 · Jacob E. Thomas
  7. 47:40 54:50

    六步协议与专家回路的工程化

    给出可复现的六步评测协议,论证领域专家在回路是技术要求而非礼节;专家成本落在构建时与门禁时(诊断题、加权规约、金标集),而非运行时。

    忠实是输出与文献记录之间的关系,只看输出的自动指标在结构上裁决不了它——人格上线前与换基座模型后必须过专家门禁。

    3083s起讲者明确按幻灯片展开工程化落地,内容以要点清单为主,看清协议六步的幻灯片即可,其余可听。▶ 跳到 47:40
    讲者 · Jacob E. Thomas
  8. 54:59 58:13

    起点与终点:病房里的米兰达失真

    揭示整个研究的个人起点(病房中的米兰达失真经历),并以邀请收尾:六步协议随论文全部公开,任何有前沿模型的团队都可用自己的人物并行复现。

    这不是一家之言的基准,而是一套开放仪器——复现它,用你自己的人物。

    情感化的口头收尾,无画面依赖,但值得完整听完以理解“米兰达假说”命名的由来。▶ 跳到 54:59
    讲者 · Jacob E. Thomas