四分钟实测:给智能体换「眼睛」,比换模型更管用
Browser Agents Don't Need Better Models. They Need Better Eyes. - Kushan Raj, ARK · Kushan Raj
全片 4 分钟·真正值得盯屏约 3 分钟·3 个必看点
- 0:00 – 0:18听
一个没人真正在用的好点子
开场抛出现状:浏览器智能体的概念很吸引人,但实际采用率极低。讲者把目标定为让它更快、更便宜、更可靠。
问题不是「能不能做」,而是慢和不可靠让它进不了日常使用。
纯口头交代背景和动机,屏幕上没有需要盯着看的东西,边做别的事听着就行。▶ 跳到 0:00讲者 · Kushan Raj - 0:18 – 0:52看
现有智能体慢到什么程度
在需要连续多步操作的浏览器基准测试里演示现有智能体的表现:仅仅点一个开始按钮就花掉十到二十秒,一个三十步的任务在第一步就已经举步维艰。
长序列任务的失败不是偶发,而是每一步都在缓慢消耗,累积成必然崩盘。
慢的程度只有看着进度条一秒秒走才有体感,转述成文字会完全失真,这段要盯着屏幕。▶ 跳到 0:18讲者 · Kushan Raj - 0:52 – 1:36看
反直觉的判断:模型没问题
讲者提出核心假设——模型已经足够聪明,短板在模型周围的基础设施。失败案例里智能体不是不会想,而是反复点击却读不懂页面到底发生了什么变化。同时首次亮出自家方案的运行效果。
把「智能体做不好」归咎于模型能力,方向就找错了;它缺的是对页面状态的感知。
论点和第一段自家演示是叠在一起讲的,屏幕上正在跑的那个更快的流程就是论据本身,只听会漏掉对照。▶ 跳到 0:52讲者 · Kushan Raj - 1:36 – 2:14看
实测一:下载证件文件
同一个下载 Aadhaar 的任务,两个智能体并排跑。基于截图循环的 Claude 智能体点完第一个按钮就开始反复截图、滚动、再截图,整套流程耗时约两分钟;讲者的智能体换用更便宜的模型,几乎立刻完成。
截图看到的只是页面局部,智能体必须靠滚动去「摸索」,时间就消耗在这里。
两边并排跑的画面差距是全场最直观的一幕,那种一边空转一边已经结束的对比必须亲眼看。▶ 跳到 1:36讲者 · Kushan Raj - 2:14 – 2:51看
实测二:陌生网站上的日期选择
换到一个加拿大徒步预订网站,界面对智能体不友好。Claude 最终没能选中日期直接卡死,讲者的智能体顺利选好日期完成预订。
真正区分优劣的是陌生、不规范的网站,日期控件这类交互最容易暴露表示层的缺陷。
卡死发生在日期控件的那几秒操作上,只有看着鼠标在日历里反复试探才知道它到底败在哪一步。▶ 跳到 2:14讲者 · Kushan Raj - 2:51 – 3:24略
打算怎么交付:开源与产品形态
讲者说明代码本身没有太强的防御壁垒,因此考虑把项目开源;产品形态还在权衡,可能做成一个接受 URL 和意图、替你执行并返回结果的接口,也可能是网站或浏览器插件。
护城河不在代码,所以他更倾向开源换取采用率——这也解释了为什么整场都在谈基础设施而非模型。
这段主要是配着几行命令示例在讲规划,方向性内容多,扫一眼画面听个结论即可。▶ 跳到 2:51讲者 · Kushan Raj - 3:24 – 4:21听
技术细节:1800 token 看完整页
给出关键数字对比:完整 DOM 约两万 token,一张只覆盖页面局部的截图约 1100 token,而他设计的 markdown 压缩表示只要约 1800 token 就能让模型看到整个网站。配套还有一套端到端的页面状态追踪,告诉智能体哪些元素新出现、哪些消失、遮挡目标的东西是否已移除、某次点击为什么没生效。
价值不只在省 token,而在于「看得见整页 + 知道刚才改变了什么」,智能体才有可能规划长序列操作。
结尾这段基本是讲者口述数字和机制,屏幕没有再演示什么,专心听那几个 token 数字和反馈项就够了。▶ 跳到 3:24讲者 · Kushan Raj