9分钟讲透为什么“会验证”正在取代“会写代码”:亲手构建的 Vector Harness 实战复盘。
Your coding agent doesn't always follow your rules — Talha Sheikh, Checkout.com · Talha Sheikh
全片 10 分钟·真正值得盯屏约 3 分钟·2 个必看点
- 0:15 – 2:00听
痛点:“任务完成”不可信
从日常场景切入:agent 报告完成后实际仍有失败或缺失,用户被迫自己充当唯一的验收层。
问题的本质是信任——你无法信任 agent 真的把任务做完了。
纯口头铺垫问题背景,无关键画面,通勤听即可。▶ 跳到 0:15讲者 · Talha Sheikh - 2:00 – 3:30看
Vector V1:hooks 确定性校验
讲解 Vector Harness 的工作机制:Claude hooks 在每次会话结束时按配置文件跑确定性测试,失败结果回喂给 Claude 循环重试直到全部通过。
验证要做成确定性的自动闭环,而不是靠人肉复查。
137.88s 处是 LLM 判定的核心视觉时刻,机制流程配画面理解效率远高于纯听。▶ 跳到 2:00讲者 · Talha Sheikh - 3:30 – 5:15听
Enforce, don't instruct
论证再详尽的 spec、MCP server 和上下文工程都只是“给指令”,指令不等于验证,必须在 agent 声称完成的那一刻强制校验。
写更好的提示词解决不了可靠性问题,强制执行才能。
观点论述为主,无强视觉依赖,适合听着记住这句口号。▶ 跳到 3:30讲者 · Talha Sheikh - 5:15 – 6:25看
护栏越硬,模型可以越小
确定性护栏完善后,可用 Haiku 甚至开源模型替代昂贵前沿模型完成同样任务,还能叠加异步任务进一步摊薄成本。
在 harness 上多投入的时间,会以推理成本的量级下降回报你。
325.51s 是 LLM 判定的价值时刻,成本对比论证配图看更直观。▶ 跳到 5:15讲者 · Talha Sheikh - 6:25 – 7:18听
反驳:能力提升≠可靠性提升
回应“更聪明的模型会让 enforcement 层多余”的质疑:新模型提升的是 capability,capability 不自动换来 reliability。
别指望下一代模型替你解决可靠性问题。
简短的口头反驳,无画面依赖。▶ 跳到 6:25讲者 · Talha Sheikh - 7:18 – 8:30略
行业现状:人人自建、互不通用
以 Qodo 等公司的 PR 审查闭环为例,说明“默认不信任 agent 产出”已成行业共识,但各家 enforcement 方案私有割裂、难以标准化。
harness 的定义必须包含验证,而这一层目前没有通用标准。
448.15s 讲者指着幻灯片上的公司版图(“over here”),扫一眼图即可,不必逐句看。▶ 跳到 7:18讲者 · Talha Sheikh - 8:30 – 9:48听
结语:价值转移到验证设计
收束全片:agent 产码再快,交付瓶颈仍在验证层;工程师的核心价值正从“写出的代码”转向“设计的验证”。
未来面试问的不是“你会不会写代码”,而是“你会不会验证”。
总结性口头陈词,记住范式转移这一句就够。▶ 跳到 8:30讲者 · Talha Sheikh