心理测量学搬进 LLM 评测:揪坏题、砍八成题量、还能测蒸馏亲缘
Stop Evaluating Models Like It's the 50s - Alejandro Vidal, Mindmakers · Alejandro Vidal
全片 24 分钟·真正值得盯屏约 17 分钟·3 个必看点
- 0:02 – 2:50看
为什么「数答对题数」是错的
开场先摆出几个模型在同一基准上的准确率表格,指出这种算法默认每道题一样重要。随后引入项目反应理论:把每道题当成独立变量,给它一条从模型能力映射到答对概率的曲线,难度就是这条曲线穿过 50% 的那个点。
把题目当成有难度、有性格的测量工具,而不是等权重的计分格子。
那条 S 形曲线和标在上面的 50% 交点是后面所有内容的地基,讲者一直在指着图说「这里」,只听声音会跟丢难度参数到底是曲线上的哪个位置。▶ 跳到 0:02讲者 · Alejandro Vidal - 2:50 – 7:08略
区分度:好题、废题和负分题
在难度之外引入第二个参数——曲线的陡峭程度,也就是这道题区分强弱模型的能力。陡的题信息量大,平的题几乎和智能无关,还有一类题斜率是负的,越聪明的模型越容易答错。最后用一个 337 题的例子收束。
题目本身也要被评测:斜率为负的题不是难题,是坏题。
内容主要靠一组并排的曲线图对比陡峭、平坦和反向三种形态,形状差别一眼就能认出来,不必逐句跟,扫图加听结论即可。▶ 跳到 2:50讲者 · Alejandro Vidal - 7:08 – 10:20看
能力值带区间,坏题自动浮出水面
给出模型能力估计与它的似然区间,说明分数第一次有了置信度和自带参照系。接着演示怎么用区分度为负这条线索自动圈出可疑题目,再让另一个模型低成本复核。
分数相近不等于能力相近,Gemini 和 Claude 的能力差了接近一个标准差,因为它答对的是更难的题。
关键在于带误差棒的能力分布图——两个模型的区间是否重叠,就是「差距是否真实」的判据,这个视觉信息用语言复述会失真。▶ 跳到 7:08讲者 · Alejandro Vidal - 10:20 – 14:20看
484 题砍到 97 题,排名不变
按区分度从高到低选题,把 484 题的基准压到约 97 题,与完整基准的排名相关仍有 0.99,省下大量时间和 token。还展示了随机抽题作为对照,并点名 GPQA 是个反例式的好基准——每道题都高区分度且信息互不重叠。
「题目越多越准」是错觉,曲线重叠的题只是在重复提供同一份信息,最优规模是可以算出来的。
精选题集与随机题集两条排名曲线并排放在一起,差距和重合的位置都在图上,这是全场最实用的一张对照图。▶ 跳到 10:20讲者 · Alejandro Vidal - 14:20 – 17:30看
残差登场:用答题一致性排查线上故障
有了每道题的曲线,就能算出每个模型在每道题上的预期表现和实际表现之差。预期 86% 该答对却答错,这种不一致会被立刻标出来。如果某个模型整片区域都不一致,往往不是模型笨,而是部署环节出了问题。
评测残差可以当运维告警用——大面积异常通常意味着推理平台没真正跑对模型,或者量化配置错了。
每题一个色块、按难度排列的一致性矩阵,红点扎堆的位置就是结论本身;离开这张图,「不一致」只是个抽象说法。▶ 跳到 14:20讲者 · Alejandro Vidal - 17:30 – 21:15看
防泄漏指纹题与题目偏差分析
提出一套适应性方案:所有组织共用一套锚题保证可比,同时给每个组织单独发一套极难题。几个月后若某家的新模型只在自己那套题上表现好得离谱,就能推断基准被拿去训练了。随后把心理学的题目偏差分析搬过来,为开源和闭源两组模型分别拟合曲线,找出系统性偏向某一方的题。
泄漏不用抓现行,用只有对方见过的那批题的残差异常就能反推。
两组残差均值的对比柱状图差距极其悬殊,以及偏差题上两条不重合的拟合曲线,都是「一眼看懂、听不出来」的类型。▶ 跳到 17:30讲者 · Alejandro Vidal - 21:15 – 23:34听
DNA 指纹查蒸馏,以及下一步
用残差向量的相关矩阵和低维投影展示模型亲缘:同实验室模型抱团,同模型不同版本相邻,DeepSeek 的蒸馏版与 Qwen 的相关度约 0.38 直接暴露血缘。结尾谈未来方向——多维能力模型、跨基准合并、以及把对齐也纳入测量。
答题模式是模型的指纹,无需对方配合就能识别未授权蒸馏与模型血缘。
指纹散点图在上一段已经看过,这里主要是讲者用几个具体模型举例并展望后续研究,听论述即可,末尾没有新的关键图形。▶ 跳到 21:15讲者 · Alejandro Vidal