一个可复现实验证明:你的角色AI评测,测不出汉密尔顿“读过自己的音乐剧”
The Miranda Hypothesis: How Hamilton Poisoned Persona Evals - Jacob E. Thomas, Results Gen · Jacob E. Thomas
全片 58 分钟·真正值得盯屏约 25 分钟·3 个必看点
- 0:05 – 8:17看
开场演示与三个范式阶段
先展示角色扮演语言代理的规模化现实与开源框架Companion,现场让林肯回答战争权问题得到“貌似正确”的答案;随后梳理领域已有的三个范式阶段,抛出核心论题。
记住这个林肯答案里的“固有行政权力”——它听起来像林肯,但整场演讲将证明它是二十世纪的概念。
148s起是现场实例化演示,是全片最重要的伏笔,需要亲眼看到那个“流畅而可信”的输出才能体会后面的拆解力度。▶ 跳到 0:05讲者 · Jacob E. Thomas - 8:22 – 17:49看
面具与镜子:米兰达假说登场
论证“令人信服”与“忠实”是独立属性,现有评测(如InCharacter的80.7%)只测前者;并置模型汉密尔顿与文献汉密尔顿,提出米兰达假说:文化主导表征系统性覆写一手文献。
人格一致性满分的汉密尔顿,可以同时“读过自己的百老汇音乐剧”——评测在结构上无法检测这种主导失效。
本段有值得看的画面:675s的实证并置需要看两段文本的具体措辞差异(情感叙事弧 vs 法条化句法),听是听不出来的。▶ 跳到 8:22讲者 · Jacob E. Thomas - 17:55 – 21:59听
证据与机制:为什么对齐反而放大失真
用Schuyler宅邸讲解员“反教音乐剧”的人类实证,说明语料失衡如何压倒文献;并论证偏好优化因标注者也被同一文化叙事塑造而奖励神话化输出,时间锁定语料同样救不了。
对齐不是修复而是“算法性谄媚”:修复必须发生在“相遇”处,而非语料基底。
本段是纯口头论述与轶事证据,无画面依赖,通勤听即可。▶ 跳到 17:55讲者 · Jacob E. Thomas - 22:06 – 33:38听
第四范式:认识论模拟及其架构抉择
提出“认识论模拟”:人格是配置而非模型属性,由提示、一手文献、时间锚、现成模型、持解释监护权的人组成;并给出反直觉结论——对人格保真,微调比上下文注入更糟。
“你不训练人格,你组装一次相遇,并保留凭据”——上下文窗口可审计、可回滚,且是人人可用的“厨房餐桌能力”。
三个章节均无视觉依赖,是全片论证密度最高的口头部分,适合专注听;概念多,可配合倍速回放。▶ 跳到 22:06讲者 · Jacob E. Thomas - 33:46 – 40:39略
棱镜实验:预注册的林肯四时刻设计
以棱镜为概念模型(白光=合成人格,棱镜=语料+时间锚,光谱=分开保持的多个自我),给出4个历史时刻×3种播种条件(一手文献/传记/裸模型)的实验矩阵。
C3裸模型是“无棱镜的白光”,充当米兰达失真的对照基线;全部预测在采集数据前预注册并盖时间戳。
棱镜示意与实验矩阵是幻灯片图表,扫一眼矩阵结构即可跟上,不必逐秒盯看。▶ 跳到 33:46讲者 · Jacob E. Thomas - 40:43 – 47:36看
评分规约与单格解剖(全片高潮)
评分规约刻意剔除“听起来像不像”并把时代错置权重压到40%;随后回扣开场演示:那个林肯答案正是C3×1847格的输出,与1848年林肯致Herndon的真实信件逐项对照打分。
“朴素而忠实”必须压过“流畅而时代错置”——把声音设为评分轴,恰是去奖励仪器本要捕捉的错误。
本段视觉依赖强:有斯皮尔伯格《林肯》片段、真实信件原文、以及观测结果与预注册预测分栏的评分格,画面本身就是证据链。▶ 跳到 40:43讲者 · Jacob E. Thomas - 47:40 – 54:50略
六步协议与专家回路的工程化
给出可复现的六步评测协议,论证领域专家在回路是技术要求而非礼节;专家成本落在构建时与门禁时(诊断题、加权规约、金标集),而非运行时。
忠实是输出与文献记录之间的关系,只看输出的自动指标在结构上裁决不了它——人格上线前与换基座模型后必须过专家门禁。
3083s起讲者明确按幻灯片展开工程化落地,内容以要点清单为主,看清协议六步的幻灯片即可,其余可听。▶ 跳到 47:40讲者 · Jacob E. Thomas - 54:59 – 58:13听
起点与终点:病房里的米兰达失真
揭示整个研究的个人起点(病房中的米兰达失真经历),并以邀请收尾:六步协议随论文全部公开,任何有前沿模型的团队都可用自己的人物并行复现。
这不是一家之言的基准,而是一套开放仪器——复现它,用你自己的人物。
情感化的口头收尾,无画面依赖,但值得完整听完以理解“米兰达假说”命名的由来。▶ 跳到 54:59讲者 · Jacob E. Thomas