EN
AI Engineer World's Fair

别怪模型不会做图——换媒介:HTML 才是智能体做图形的原生语言。

HTML is All You Need (for Agents to Make Graphics) - Amol Kapoor, Nori · Amol Kapoor

7 min
AgentAI 编程Design-to-CodeAI 产品

全片 7 分钟·真正值得盯屏约 5 分钟·3 个必看点

橙色 = 推荐必看的 5 分钟其余读导览就够
逐段导览 · 6 段
  1. 0:10 1:15

    问题提出:智能体为什么做不好图形

    Amol Kapoor 抛出核心论断:智能体图形能力差的根源不在模型能力,而在我们塞给它的媒介和工具——它们全是按人类思维设计的。

    「模型不行」是误诊,真正的病因是媒介错配。

    开场为纯口头立论,无关键画面,听清论点框架即可。▶ 跳到 0:10
    讲者 · Amol Kapoor
  2. 1:15 2:10

    为人类设计的工具注定失败

    拆解 PowerPoint、Figma、Canva:画布交互(点击、拖拽、对齐)为人手人眼设计,数据格式封闭;Figma MCP、截图替换循环等现有智能体方案仍在按人类方式解题。

    把人类工具原样交给智能体,产出必然错位重叠、不可用。

    此段有画布工具与智能体产出翻车的对照画面(visualMoment 89s),看图比听描述更直观。▶ 跳到 1:15
    讲者 · Amol Kapoor
  3. 2:10 3:20

    SVG 鹈鹕测试:一场集体误判

    复盘 Simon Willison 的「SVG 画鹈鹕骑自行车」测试——各模型表现确实糟糕,业界(包括 ArcAGI 类基准)据此断言模型不会空间推理。讲者指出:让 AI 手写 SVG 本身就违背它的思维方式。

    人类靠画布思考,模型靠语言、token 和结构思考——测试测的是媒介错配,不是能力上限。

    鹈鹕测试的失败样例是幻灯片图像(visualMoment 145s),扫一眼失败效果即可,论证部分靠听。▶ 跳到 2:10
    讲者 · Amol Kapoor
  4. 3:20 4:50

    答案:HTML 是模型的原生媒介

    论证 HTML 的三重优势:标签自带语义(标题、图表、网格)、模型在海量样本上训练过、布局交由浏览器渲染成像素。同一鹈鹕任务改用 HTML 即产出可读结果。

    模型不需要摆放任何坐标,就免费获得图表、字体、动效——这是全片最核心的方法论支点。

    247s 处的 HTML 版鹈鹕对比是全片关键画面,必须亲眼看前后差异才有说服力。▶ 跳到 3:20
    讲者 · Amol Kapoor
  5. 4:50 6:00

    Nori 投产实证:从 deck 到视频

    方法落地:编辑格式与演示格式解耦——用 HTML 编辑、按需渲染成 PDF 等格式。Nori 已用它生产董事会演示、销售 deck、品牌化文档,连本演讲视频都是纯 HTML/CSS(div 堆叠)渲染的。

    幻灯片≠PowerPoint:观众只关心演示态,编辑格式可以任意选智能体最擅长的。

    320s 处展示真实投产案例,且「本视频即 HTML 渲染」这一自证只有看画面才能体会。▶ 跳到 4:50
    讲者 · Amol Kapoor
  6. 6:00 6:53

    结论:像模型一样思考

    收尾算账:全球每天约 3.4 万人年耗在做幻灯片上,大部分花在格式排版琐事;接入公司数据后智能体可端到端生成整份 deck,10 小时的活应缩到约 25 分钟。「coding agent」只是营销误称——给对语言,智能体几乎无所不能。

    停止像用户一样思考,改为像模型一样思考——对图形任务,这门语言就是 HTML。

    结尾为口头总结与数据论述,无独立视觉时刻,记住方法论迁移即可。▶ 跳到 6:00
    讲者 · Amol Kapoor