EN
AI Engineer World's Fair

心理测量学搬进 LLM 评测:揪坏题、砍八成题量、还能测蒸馏亲缘

Stop Evaluating Models Like It's the 50s - Alejandro Vidal, Mindmakers · Alejandro Vidal

24 min
Evals

全片 24 分钟·真正值得盯屏约 17 分钟·3 个必看点

橙色 = 推荐必看的 17 分钟其余读导览就够
逐段导览 · 7 段
  1. 0:02 2:50

    为什么「数答对题数」是错的

    开场先摆出几个模型在同一基准上的准确率表格,指出这种算法默认每道题一样重要。随后引入项目反应理论:把每道题当成独立变量,给它一条从模型能力映射到答对概率的曲线,难度就是这条曲线穿过 50% 的那个点。

    把题目当成有难度、有性格的测量工具,而不是等权重的计分格子。

    那条 S 形曲线和标在上面的 50% 交点是后面所有内容的地基,讲者一直在指着图说「这里」,只听声音会跟丢难度参数到底是曲线上的哪个位置。▶ 跳到 0:02
    讲者 · Alejandro Vidal
  2. 2:50 7:08

    区分度:好题、废题和负分题

    在难度之外引入第二个参数——曲线的陡峭程度,也就是这道题区分强弱模型的能力。陡的题信息量大,平的题几乎和智能无关,还有一类题斜率是负的,越聪明的模型越容易答错。最后用一个 337 题的例子收束。

    题目本身也要被评测:斜率为负的题不是难题,是坏题。

    内容主要靠一组并排的曲线图对比陡峭、平坦和反向三种形态,形状差别一眼就能认出来,不必逐句跟,扫图加听结论即可。▶ 跳到 2:50
    讲者 · Alejandro Vidal
  3. 7:08 10:20

    能力值带区间,坏题自动浮出水面

    给出模型能力估计与它的似然区间,说明分数第一次有了置信度和自带参照系。接着演示怎么用区分度为负这条线索自动圈出可疑题目,再让另一个模型低成本复核。

    分数相近不等于能力相近,Gemini 和 Claude 的能力差了接近一个标准差,因为它答对的是更难的题。

    关键在于带误差棒的能力分布图——两个模型的区间是否重叠,就是「差距是否真实」的判据,这个视觉信息用语言复述会失真。▶ 跳到 7:08
    讲者 · Alejandro Vidal
  4. 10:20 14:20

    484 题砍到 97 题,排名不变

    按区分度从高到低选题,把 484 题的基准压到约 97 题,与完整基准的排名相关仍有 0.99,省下大量时间和 token。还展示了随机抽题作为对照,并点名 GPQA 是个反例式的好基准——每道题都高区分度且信息互不重叠。

    「题目越多越准」是错觉,曲线重叠的题只是在重复提供同一份信息,最优规模是可以算出来的。

    精选题集与随机题集两条排名曲线并排放在一起,差距和重合的位置都在图上,这是全场最实用的一张对照图。▶ 跳到 10:20
    讲者 · Alejandro Vidal
  5. 14:20 17:30

    残差登场:用答题一致性排查线上故障

    有了每道题的曲线,就能算出每个模型在每道题上的预期表现和实际表现之差。预期 86% 该答对却答错,这种不一致会被立刻标出来。如果某个模型整片区域都不一致,往往不是模型笨,而是部署环节出了问题。

    评测残差可以当运维告警用——大面积异常通常意味着推理平台没真正跑对模型,或者量化配置错了。

    每题一个色块、按难度排列的一致性矩阵,红点扎堆的位置就是结论本身;离开这张图,「不一致」只是个抽象说法。▶ 跳到 14:20
    讲者 · Alejandro Vidal
  6. 17:30 21:15

    防泄漏指纹题与题目偏差分析

    提出一套适应性方案:所有组织共用一套锚题保证可比,同时给每个组织单独发一套极难题。几个月后若某家的新模型只在自己那套题上表现好得离谱,就能推断基准被拿去训练了。随后把心理学的题目偏差分析搬过来,为开源和闭源两组模型分别拟合曲线,找出系统性偏向某一方的题。

    泄漏不用抓现行,用只有对方见过的那批题的残差异常就能反推。

    两组残差均值的对比柱状图差距极其悬殊,以及偏差题上两条不重合的拟合曲线,都是「一眼看懂、听不出来」的类型。▶ 跳到 17:30
    讲者 · Alejandro Vidal
  7. 21:15 23:34

    DNA 指纹查蒸馏,以及下一步

    用残差向量的相关矩阵和低维投影展示模型亲缘:同实验室模型抱团,同模型不同版本相邻,DeepSeek 的蒸馏版与 Qwen 的相关度约 0.38 直接暴露血缘。结尾谈未来方向——多维能力模型、跨基准合并、以及把对齐也纳入测量。

    答题模式是模型的指纹,无需对方配合就能识别未授权蒸馏与模型血缘。

    指纹散点图在上一段已经看过,这里主要是讲者用几个具体模型举例并展望后续研究,听论述即可,末尾没有新的关键图形。▶ 跳到 21:15
    讲者 · Alejandro Vidal