绕开200毫秒延迟暴政:“语音进、视觉出”的实时代理工程三法
Voice In, Visuals Out: The Agony and the Ecstasy - Allen Pike, Forestwalk Labs · Allen Pike
全片 13 分钟·真正值得盯屏约 4 分钟·2 个必看点
- 0:01 – 1:10听
开场:Karpathy 的交互新范式
以 Karpathy “语音是首选输入、视觉是首选输出”为引子,指出这与主流文字进出相悖,却更贴近人类偏好。
“语音进、视觉出”不是噱头,而是被论证的人类偏好交互形态。
纯观点铺陈,无关键画面,通勤听即可。▶ 跳到 0:01讲者 · Allen Pike - 1:10 – 2:40看
视觉输出的能力跃迁
展示模型近期已能生成富 HTML、可视化解释、可交互控件乃至精美插图,视觉输出上限被显著抬高。
这一范式在近几个月才真正可行,因为模型的视觉生成能力刚够格。
72 秒处是 LLM 判定的视觉时刻,输出示例画面比口述直观得多。▶ 跳到 1:10讲者 · Allen Pike - 2:40 – 4:40听
为语音正名:最高带宽的输入
口语每分钟词数超过打字、语调还承载额外信息;语音输入的坏名声来自 Siri 式又慢又笨的历史体验,而非语音本身。
语音是人类带宽最高的表达方式,被冤枉的是糟糕的实现。
论证性内容,靠讲述展开,无需盯屏。▶ 跳到 2:40讲者 · Allen Pike - 4:40 – 7:02听
延迟的暴政
无缝语音对话要求 200 毫秒以内完成网络、转文字与推理全链路,目前几乎无解;而人对视觉响应宽容到约 1 秒——“语音进、视觉出”正好绕开瓶颈。
不必等新推理架构:换成视觉输出,1 秒延迟预算就足够无缝。
核心论证段,数字口头给出即可跟上,幻灯片仅辅助。▶ 跳到 4:40讲者 · Allen Pike - 7:04 – 9:00略
经验一:选真正快的模型
GPT-5 Mini 实测 P95 延迟 5–10 秒、从不够快;应选 Haiku 级或小型开源模型,重任务异步转交深度思考的大模型再交织回响应。
实时链路用小快模型兜底,大模型只做异步深加工。
有延迟数据对比的幻灯片,扫一眼数字即可,重点在结论。▶ 跳到 7:04讲者 · Allen Pike - 9:00 – 11:00听
经验二:边说边急切推理
不要等约 1 秒静默才触发推理——那会耗光预算;应在用户说话过程中每 1–2 秒急切发送推理请求,即使不确定对方是否说完。
延迟预算要在用户还在说话时就开始花,而不是说完才启动。
策略性口头论述,无演示画面,理解机制即可。▶ 跳到 9:00讲者 · Allen Pike - 11:00 – 13:04看
经验三:稳定前缀缓存与收尾
让约 90% 上下文在请求间保持不变、只动最后 10% 并压缩输出 token,可让推理便宜、快最多约 90%;这一架构正成为多数 LLM 应用的收敛方向。
“前缀稳定 + 少输出”是省钱提速的通用架构,不限于语音场景。
缓存结构靠图示理解最快,且是全片最值得截图带走的一页。▶ 跳到 11:00讲者 · Allen Pike