EN
AI Engineer World's Fair

绕开200毫秒延迟暴政:“语音进、视觉出”的实时代理工程三法

Voice In, Visuals Out: The Agony and the Ecstasy - Allen Pike, Forestwalk Labs · Allen Pike

13 min
AI 产品AgentContext

全片 13 分钟·真正值得盯屏约 4 分钟·2 个必看点

橙色 = 推荐必看的 4 分钟其余读导览就够
逐段导览 · 7 段
  1. 0:01 1:10

    开场:Karpathy 的交互新范式

    以 Karpathy “语音是首选输入、视觉是首选输出”为引子,指出这与主流文字进出相悖,却更贴近人类偏好。

    “语音进、视觉出”不是噱头,而是被论证的人类偏好交互形态。

    纯观点铺陈,无关键画面,通勤听即可。▶ 跳到 0:01
    讲者 · Allen Pike
  2. 1:10 2:40

    视觉输出的能力跃迁

    展示模型近期已能生成富 HTML、可视化解释、可交互控件乃至精美插图,视觉输出上限被显著抬高。

    这一范式在近几个月才真正可行,因为模型的视觉生成能力刚够格。

    72 秒处是 LLM 判定的视觉时刻,输出示例画面比口述直观得多。▶ 跳到 1:10
    讲者 · Allen Pike
  3. 2:40 4:40

    为语音正名:最高带宽的输入

    口语每分钟词数超过打字、语调还承载额外信息;语音输入的坏名声来自 Siri 式又慢又笨的历史体验,而非语音本身。

    语音是人类带宽最高的表达方式,被冤枉的是糟糕的实现。

    论证性内容,靠讲述展开,无需盯屏。▶ 跳到 2:40
    讲者 · Allen Pike
  4. 4:40 7:02

    延迟的暴政

    无缝语音对话要求 200 毫秒以内完成网络、转文字与推理全链路,目前几乎无解;而人对视觉响应宽容到约 1 秒——“语音进、视觉出”正好绕开瓶颈。

    不必等新推理架构:换成视觉输出,1 秒延迟预算就足够无缝。

    核心论证段,数字口头给出即可跟上,幻灯片仅辅助。▶ 跳到 4:40
    讲者 · Allen Pike
  5. 7:04 9:00

    经验一:选真正快的模型

    GPT-5 Mini 实测 P95 延迟 5–10 秒、从不够快;应选 Haiku 级或小型开源模型,重任务异步转交深度思考的大模型再交织回响应。

    实时链路用小快模型兜底,大模型只做异步深加工。

    有延迟数据对比的幻灯片,扫一眼数字即可,重点在结论。▶ 跳到 7:04
    讲者 · Allen Pike
  6. 9:00 11:00

    经验二:边说边急切推理

    不要等约 1 秒静默才触发推理——那会耗光预算;应在用户说话过程中每 1–2 秒急切发送推理请求,即使不确定对方是否说完。

    延迟预算要在用户还在说话时就开始花,而不是说完才启动。

    策略性口头论述,无演示画面,理解机制即可。▶ 跳到 9:00
    讲者 · Allen Pike
  7. 11:00 13:04

    经验三:稳定前缀缓存与收尾

    让约 90% 上下文在请求间保持不变、只动最后 10% 并压缩输出 token,可让推理便宜、快最多约 90%;这一架构正成为多数 LLM 应用的收敛方向。

    “前缀稳定 + 少输出”是省钱提速的通用架构,不限于语音场景。

    缓存结构靠图示理解最快,且是全片最值得截图带走的一页。▶ 跳到 11:00
    讲者 · Allen Pike