Gemini 3.5 Transcribe

日本谷歌于8月26日发布了最新的语音识别模型“Gemini 3.5 Transcribe”。目前,该模型的公测版本已面向开发者开放,用户可通过Google AI Studio和Google Antigravity访问;企业用户则可通过Gemini Enterprise Agent Platform使用公测版本;普通用户则可在macOS版的Gemini应用(仅支持英语)以及部分国家和语言的Android版Gboard Rambler中体验。未来,企业版的Gemini Enterprise for Customer Experience和普通用户的Chrome版也将陆续推出。

该模型支持超过85种语言,能够识别最多三位说话者,并支持自定义专业术语词汇。它能够有效处理背景噪音、专业术语和语音犹豫,将原始音频精准转换为结构化文本。

针对开发者,谷歌提供了两种API接口:一是支持实时双向流处理的“Live API”,二是针对录音音频进行说话者识别和单词级时间戳标注的“Interactions API”。

在性能方面,Gemini 3.5 Transcribe较前代模型“Chirp 3”有显著提升。根据生成AI模型对比网站“Artificial Analysis”的测试,实时流处理的转录时间缩短了4.0%,非流处理缩短了2.6%,整体转录时间减少了70%。在多语言语音基准测试“FLEURS”中,流处理误差率为5.50%,非流处理误差率为5.04%。

性能对比图