EN
Figma Config

设计师不用新学 ML:写北极星、校准分歧这些老手艺,正是主导 AI evals 的核心能力。

Own the loop: how designers and researchers win with AI evals ft. Setor Zilevu (Figma) | Config 2026 · Rachel

19 min
EvalsAI 产品

全片 18 分钟·真正值得盯屏约 6 分钟·3 个必看点

橙色 = 推荐必看的 6 分钟其余读导览就够
逐段导览 · 7 段
  1. 0:11 2:20

    开场:为什么是设计师讲 evals

    Rachel 与 Megan 开场并引出讲者 Setor Zilevu,铺垫本场主题——evals 不是机器学习科学家的专属领域。

    这不是一场 ML 技术讲座,而是讲给设计与研究从业者的能力迁移课。

    纯开场引入与讲者介绍,无关键画面,听着进入语境即可。▶ 跳到 0:11
    讲者 · Rachel / Megan
  2. 2:20 5:00

    John 的故事:通过全部测试却仍然错

    Setor 讲述自己为中风康复者构建的系统:技术上完全按规格执行、测试全绿,但放到 John 面前依然是错的产品。

    模型准确不等于产品正确,“好”的定义必须与领域专家和真实用户对齐。

    屏幕上两次展示康复应用实景(153s、189s 均为标记的视觉时刻),看着画面才能理解“哪里错了”。▶ 跳到 2:20
    讲者 · Setor Zilevu
  3. 5:00 7:12

    没有标准时,判断只能靠猜

    从 Michael Scott 梗图到同一 prompt 生成的两张设计稿现场对比,演示在没有事先定义评判标准时,对 AI 输出的优劣判断毫无依据。

    在动手评估之前,必须先回答“好是什么”——否则一切打分都是猜测。

    本段密集出现视觉时刻(346s、369s、403s),两稿对比是需要亲眼看的现场互动。▶ 跳到 5:00
    讲者 · Setor Zilevu
  4. 7:12 10:55

    evals 去神秘化:两个迷思与闭环方法论

    拆穿“evals 纯属工程问题”与“好只需定义一次”两个迷思,指出人类期望持续演进;再借 Edna 类比给出方法论:定义意图→设定成功标准→测量→学习→重复。

    AI 输出是概率性的,质量不能在末端验证,只能全程用闭环持续引导。

    主体是口头论证,逻辑链靠听;唯一值得抬头看的 Edna 段已单独列入必看片段。▶ 跳到 7:12
    讲者 · Setor Zilevu
  5. 10:55 14:13

    三层评估:human、auto、UX

    讲解 human evals(rubric + 评分员校准)、auto evals(LLM 学习校准过的 rubric 实现规模化)与 UX evals(补上真空打分缺失的真实上下文)。

    评分员未校准时,auto evals 规模化的不是判断而是噪音;UX evals 补的正是前两层共同的盲区。

    内容以框架性幻灯片呈现,扫一眼三层结构图、重点听“校准”与“盲区”两处论述即可。▶ 跳到 10:55
    讲者 · Setor Zilevu
  6. 14:13 16:40

    Figma 实践:失败模式驱动的修复飞轮

    以 Figma 内部经验说明:按高频与高严重度归类失败模式、交工程逐一修复,分数持续上升并赢得高管层关注。

    质量工作按失败模式组织后,设计与研究的建议从间接影响变成直接的战略输入。

    是经验叙述而非演示,价值在案例细节与因果链,适合专注听。▶ 跳到 14:13
    讲者 · Setor Zilevu
  7. 16:40 18:15

    四个杠杆与 own the loop 号召

    总结从业者手中塑造模型行为的四个杠杆——system prompts、eval 设计、数据集、capabilities,并以“AI 只知道我们去过哪里,必须有人指方向”收束全场。

    你已有的技能改个名字就是 eval 能力:写北极星→写 rubric,综合研究发现→归类失败模式。

    收尾是纯口头的行动号召与技能映射清单,无需盯屏幕,记下四个杠杆即可。▶ 跳到 16:40
    讲者 · Setor Zilevu