98出海

Google推出新一代语音转写模型

Google推出新一代语音转写模型

8月26日,Google发布专门用于语音转文字的Gemini 3.5 Transcribe。

它支持85种以上语言和地区变体,实时版延迟低于一秒;录音版可以区分说话人、生成单词级时间戳。按Google估算,处理一小时录音的API费用最低约0.30美元。

产品目前已经通过Gemini API向开发者开放,并进入Google AI Studio和Gemini Enterprise Agent Platform。不过,开发者和企业侧仍处于公开预览阶段。

简单说,Google这次没有再做一个什么都能聊的大模型,而是给Gemini配了一名专门听写、整理录音的"速记员"。

实时版和录音版

Gemini 3.5 Transcribe分成实时和非实时两个版本。

实时版走Live API,模型名是gemini-3.5-transcribe-live,面向直播字幕、语音输入、客服通话这类边说边出的场景。Google称其延迟低于一秒。

非实时版走Interactions API,模型名是gemini-3.5-transcribe,适合处理已经录好的会议、访谈和电话录音。它能标注不同说话人,也能给出单词级时间戳。

两者都支持自动识别85种以上语言和地区变体,也能处理一句话里来回切换语言的情况。官方支持列表中包括简体中文普通话和繁体粤语。

对开发者来说,还有一个很实用的小功能:自定义词表。公司名、产品名、医学术语、缩写,都可以提前交给模型,减少"每次都错在同一个词上"的尴尬。

智能模式会修改原话

这次更容易被普通用户感知的,是"智能转写"。

比如有人说:"我们周二见——不,改周三下午两点。"普通转写会把整句照录下来;智能模式会直接整理成"我们周三下午2点见"。"嗯""啊"、重复、口误也会被清理,连续说出的一串事项还能自动排成列表。

听起来像是转写,其实已经带了一层编辑。

这既是它好用的地方,也是使用时最需要留意的地方。Google在文档里保留了两种模式:默认的verbatim逐字模式尽量保存原话;smart模式负责清理和排版。会议纪要、口述写作适合后者,采访存档、法律取证、医疗记录这类强调原始措辞的场景,更适合前者,并且仍应人工复核。

还有一个限制:智能模式不能同时启用说话人区分和单词级时间戳。想要"更好读",还是想要"更可追溯",现在得二选一。

准确率:2.6%,但并非第一

图源:Google官方博客;FLEURS所选语言与测试口径见图中注释,数值越低越好。

Google称,Gemini 3.5 Transcribe是自家目前最精准的语音转文字模型。其援引Artificial Analysis的数据称,实时流式转写的平均词错误率为4.0%,非实时转写为2.6%;与上一代Chirp 3相比,最终文本输出时间缩短70%。

不过,"Google自家最准"不等于"全行业第一"。

Artificial Analysis当前非实时语音转写榜单中,Gemini 3.5 Transcribe的AA-WER同样是2.6%,排名第五。前面还有阿里云Fun-Realtime-ASR-preview、ElevenLabs Scribe v2等模型。

这组数字说明它已经进入第一梯队,但还不足以证明在所有口音、噪声和行业术语场景里都最好。词错误率也只是一个维度,真实体验还取决于延迟、成本、语言覆盖和说话人识别。

图源:Google官方博客。该图为Google发布的厂商测试结果,不应单独视作独立评测结论。

每小时最低约0.30美元

按Google官方给出的估算,非实时转写综合成本约为每分钟0.005美元,实时版约为每分钟0.009美元。

换算下来,一小时录音分别约为0.30美元和0.54美元。这个价格只反映API的音频输入和文字输出估算,不包括存储、网络和上层应用的开发成本。

Google还提供免费层,但定价页明确写着:免费层数据可能用于改进Google产品,付费层则不会。企业把客服录音、内部会议或敏感材料送入云端前,仍需要核对具体的数据处理条款,而不是只看单价。

这些限制需要注意

Gemini 3.5 Transcribe目前有几条硬边界。

实时会话最长10分钟,而且实时版暂不支持说话人区分和单词级时间戳;录音文件单次最长1小时,打开说话人区分或单词级时间戳后,上限缩短到30分钟;三人及以上的说话人归属仍被Google标为实验功能;开启单词级时间戳还可能降低整体转写准确率。

再加上产品仍处于公开预览,接口能力、价格和限制都可能调整。

所以,它现阶段更像一名速度很快的速记员,而不是可以签字负责的记录员。直播字幕、访谈初稿、会议纪要、客服质检,都能明显省时间;涉及责任认定的原始记录,人工复核仍不能省。

Google正在扩大语音入口

Google已经把这套能力放进Android端Gboard的Rambler(目前仅覆盖部分国家和语言)、macOS版Gemini应用、Google AI Studio和Antigravity,并计划带到Chrome。

语音转写不再只是一个独立工具,而是在变成Google各类应用的输入层。用户说话,模型负责听懂、整理,再把任务交给其他Gemini模型继续处理。

对Google来说,Gemini 3.5 Transcribe未必是最吸睛的一次模型发布,却可能是很实用的一块拼图。

毕竟,大多数人并不需要每天和AI讨论一道难题,但几乎每个人,都有过"这段录音真不想再听一遍"的时刻。