MAI-Transcribe-2

美国微软公司于9月3日(当地时间)正式发布了新一代语音识别AI模型“MAI-Transcribe-2”。微软宣称该模型是“全球最快、最高精度且成本最低的语音识别模型”,在性能上超越了包括“Gemini 3.5 Transcribe”、“GPT-Transcribe”、“Whisper V3-Large”以及“Scribe v2”等竞争对手。

“MAI-Transcribe-2”是今年6月发布的“MAI-Transcribe-1.5”的升级版本,进一步提升了支持语言种类、识别精度和处理性能。

例如,在微软使用多语言语音基准测试“FLEURS”中,对包括日语在内的60种语言进行评测,平均词错误率(WER)仅为5.2%,在对比模型中表现最佳。第三方评测机构“Artificial Analysis”也给予了该模型在识别精度与处理速度兼顾方面的高度评价,WER排名位列第二。

性能对比

该模型在处理速度上表现尤为突出,特别是在长时间语音识别中优势明显。根据微软引用的“Artificial Analysis”评测结果,MAI-Transcribe-2的速度是OpenAI的“GPT-Transcribe”的10倍,ElevenLabs的“Scribe v2”的7倍,谷歌的“Gemini 3.5 Transcribe”的5倍,同时在识别精度上也实现了超越。

功能介绍

MAI-Transcribe-2的主要功能包括:

  • 说话人分离(说话人识别):能够区分录音中的不同说话人,并将发言内容分别归类。
  • 词级时间戳:为每个词汇准确标注时间,方便对齐、搜索、导航和编辑。
  • 关键词偏置:帮助识别专业术语、缩写和人名等上下文难以判断的词汇(持续支持)。
  • 转录风格切换:可选择保留口语停顿和修正的“逐字稿”模式,或去除这些内容使文本更易读的“清洁”模式。
  • 代码切换支持:支持如“印英混合语”(Hinglish)和“西英混合语”(Spanglish)等语言交替的场景。
  • 自动语言识别:无需预先指定语言,模型能自动检测当前语音所用语言(持续支持)。

此外,模型在抗噪声能力上也有显著提升,能够在嘈杂环境中保持高质量的转录效果。其应用场景包括医疗记录、法律文档编写、无障碍服务以及字幕生成等。

价格方面,MAI-Transcribe-2的收费为每小时语音0.10美元,虽然为2026年底前的限时优惠价,但相比“1.5”版本发布时的每小时0.36美元,成本降低了约72%。

目前,用户可以通过“Microsoft Foundry”、“MAI Playground”和“OpenRouter”平台体验MAI-Transcribe-2。