EN
AI Engineer World's Fair

他把「带工具的 LLM」的恐怖,交给 Lean 形式化证明来收场

"I've never seen anything scarier than an LLM with tool calls." — Erik Meijer aka @HeadinTheBox

21 min

全片 21 分钟·真正值得盯屏约 11 分钟·2 个必看点

橙色 = 推荐必看的 11 分钟其余读导览就够
逐段导览 · 6 段
  1. 0:13 2:30

    开场:这个人是谁

    主持人介绍 Leibniz Labs 的研究学者 Erik Meijer 上台,讲者随即抛出全场的引子——他见过最吓人的东西,是一个能调用工具的大模型。

    「可怕」不是修辞,指的是模型一旦能动手,错误就不再停留在文本里

    纯人物介绍和一句话立论,屏幕上没什么内容,边做别的事听掉就行▶ 跳到 0:13
  2. 2:30 7:16

    为什么工具调用最危险

    讲者展开他的核心担忧:语言模型输出文本时错了只是错了,而一旦挂上工具,模型的每一次猜测都会变成对外部世界的真实动作,且不可撤销。

    危险的来源不是模型更笨了,而是我们把「不确定的输出」直接接到了「确定会发生的副作用」上

    整段是口头论证,讲者靠层层追问推进,画面基本停在同一张底图上,闭眼听不损失信息▶ 跳到 2:30
  3. 7:16 11:38

    把 Lean 端出来

    话锋转向解法。讲者引入 Lean 这套定理证明器,解释它如何让一段陈述的正确性由机器来判定,而不是由人来相信。

    Lean 的价值在于「检查」比「生成」便宜得多——这正好对上模型会胡说但我们能验的场景

    会出现证明语法和符号,但讲者每一步都念出来了,跟着口述走比盯着符号更快理解▶ 跳到 7:16
  4. 11:41 15:00

    模型能自己写证明

    关键转折:讲者指出模型已经可以生成这些形式化证明。生成的部分允许出错,因为证明检查器会毫不留情地把错的挡在门外。

    让模型产出可验证的东西,而不是让模型产出可信的东西

    论点靠推理链条串起来,没有实机演示可看;这段值得回放一遍而不是快进▶ 跳到 11:41
  5. 15:00 18:43

    回到 AI 工程现场

    讲者把话题拉回这场大会的听众身上:这套思路落到日常构建的 Agent 和工具链上意味着什么,工程师该在哪一层加约束。

    别在提示词里祈祷模型守规矩,把规矩放进它必须通过的那道检查里

    这段是把前面结论往实践上映射,节奏偏慢,抓住讲者点名的几处落地位置就够▶ 跳到 15:00
  6. 18:43 20:54

    收尾与余味

    全场收束,讲者把开头那句「最吓人的东西」重新解释了一遍——恐怖的不是能力本身,而是我们缺少与之匹配的验证手段。

    结论一句话:先建验证,再放工具

    结尾陈词,情绪重于信息,听完那句回扣即可,不必倒回去看▶ 跳到 18:43