
2023年9月15日,日本谷歌宣布推出对话式语音AI模型“Gemini 3.8 Live”及其扩展版本“Gemini 3.8 Live Extended Thinking”。这两款模型已开始通过Gemini API、谷歌AI Studio、企业私有预览版以及部分谷歌服务向开发者和用户逐步开放,预计也将很快在Gemini Enterprise for Customer Experience中上线。
Gemini 3.8 Live专为扩展性和成本效益设计,能够几乎实时处理视觉输入,并在对话过程中自动识别并切换97种语言。即使在后台执行工具或API时,也能持续响应并保持对话流畅。
而Gemini 3.8 Live Extended Thinking则针对复杂任务处理进行了优化,能够同步进行推理和语音输出,在处理复杂工作流程的同时保持自然的对话体验。
这两款模型在多个语音代理评估指标中表现优异。Gemini 3.8 Live在用户评分的语音代理领域排名第二,并在ServiceNow的“EVA-Bench”评测中,通过平衡准确性与对话质量,提升了复杂任务的最佳表现上限。

Gemini 3.8 Live Extended Thinking在Artificial Analysis的“Speech to Speech Quality Index”中获得82.6分,超过了其他竞争对手如“GPT-Live-1 Astra”和“Grok Voice Think Fast 2.0”。此外,在Artificial Analysis的代理任务完成率(τ-Voice)和Sierra的“τ-Voice-banking”基准测试中也领先于其他模型,并在“Big Bench Audio”中取得了97.7%的高分。

在安全性方面,所有生成的语音均嵌入了谷歌的电子水印技术“SynthID”,确保能够识别出AI生成的内容,提升内容的可信度和安全保障。


