一场几乎全靠现场演示撑起来的音频 AI 实操课,从转写到唱歌
From Transcription to Live Music: Gemini's Audio Stack — Thor Schaeff, Google DeepMind · Thor Schaeff
全片 19 分钟·真正值得盯屏约 12 分钟·3 个必看点
- 0:14 – 2:19听
先把整个音频栈的地图铺开
介绍 DeepMind 音频能力的底座是 Gemini 的音频理解能力,它抓的不只是文字,还有对话语境、情绪、多人重叠说话和口音语种混杂的信息。开放模型这一支还能放到端侧跑。
这套东西的起点不是『转写』而是『听懂』,后面所有能力都长在这个底座上。
这一段基本是站着讲概念和能力边界,画面上没有比讲述本身更多的信息,边做别的边听不亏。▶ 跳到 0:14讲者 · Thor Schaeff - 2:19 – 7:16看
EchoScript:转写这件事被压成一次请求
用一个叫 EchoScript 的小应用做演示:对模型发一次请求,配上提示词和一份输出结构约定,返回里就同时带着摘要、时间戳、说话人识别、语种识别、非英语内容的英译和情绪标签。有上下文时说话人还能直接标成真名。
结构化输出让『多任务转写』塌缩成一次调用,专门的转写流水线可以省掉。
关键在屏幕上那份返回结果本身——各类信息挤在同一屏里的密度,是这一段最有说服力的部分,跳过画面就只剩一句空口承诺。▶ 跳到 2:19讲者 · Thor Schaeff - 7:16 – 9:35略
语音生成换了套玩法:从挑音色到导演
解释为什么基础音色只留了三十个左右:不再让你从庞大音色库里按性别口音筛选,而是用自然语言描述场景、口音和表演方式来定制。讲者展示了一段请求该怎么组织——音频档案、场景设定、表演指导、示例、目标文本。
音色的可塑性来自模型本来就知道各种口音和语速『听起来是什么样』,所以描述比筛选更有效。
这一段主要是把提示词的几个组成部分列在屏幕上讲解,结构一眼扫过去就明白,不必逐句跟着走。▶ 跳到 7:16讲者 · Thor Schaeff - 9:35 – 14:17看
口音变身与实时语音到语音模型
先当场把同一个基础音色调成爱尔兰口音和新加坡口音;接着介绍新发布的 Gemini 3.1 Flash Live——全双工、语音到语音,通过 WebSocket 实时吃进文本、音频和视频并返回语音与转写,讲者还打开摄像头让模型现场点评了自己的穿着。
它不是『转文字→大模型→再转语音』的级联拼装,思考能力直接长在音频模型里。
两个演示的效果都在耳朵和眼睛里:口音差别得听,摄像头那段模型对现场衣着的反应也得看着才知道延迟和自然度到什么程度。▶ 跳到 9:35讲者 · Thor Schaeff - 14:17 – 16:00听
真要上线之前的几个坑
坦白实时音频开发门槛不低,并给出两个具体限制:系统指令里设定的口音会被模型跨语言硬套,出现爱尔兰腔德语这种情况,多语言场景需要单独调指令;屏幕共享和视频帧目前每秒只能进一帧。另外所有 Gemini API 都配了给编码代理用的 Skills。
口音设定会跨语言污染、视频输入每秒一帧——这两条会直接影响你的方案设计。
全是经验之谈式的口头交代,信息都在话里,不看画面也不会漏。▶ 跳到 14:17讲者 · Thor Schaeff - 16:00 – 18:10看
Lyria 3 与 Live Jukebox:点单式做歌
介绍能生成带歌词音乐的 Lyria 3,分成做三十秒短曲的 Clip 版和做完整歌曲的 Pro 版;随后 Live Jukebox 演示把音乐生成挂成实时对话模型的一个工具,观众用语音描述想要什么歌,模型追问细节后调用工具出歌。
『实时语音代理 + 生成媒体工具调用』是个可以直接照搬的架构模板。
整段的价值在于全程跑通的现场感——对话怎么来回、模型追问什么、最后出来的歌好不好听,这些只能亲眼亲耳确认。▶ 跳到 16:00 - 18:10 – 19:14略
收尾与上手入口
收束整场内容,给出免费试用的入口和相关资源指引。
想动手的话,入口和免费额度在这一段里,记下来再走。
屏幕上主要是链接和资源清单,扫一眼截图存下就够,不用完整听完。▶ 跳到 18:10讲者 · Thor Schaeff