#语音识别

按标签聚合查看文章内容。

OpenAI发布全新语音模型,实现更自然的实时对话体验AI资讯

OpenAI发布全新语音模型,实现更自然的实时对话体验

OpenAI今日推出了全新的对话语音模型,名为GPT-Live-1和GPT-Live-1 mini,声称这些模型的语音更加自然,且在对话轮换上表现更佳。这些模型支持全双工功能,意味着它们可以同时说话和聆听,允许用户自然打断对话,并支持实时翻译等功能。 公司还宣布将默认用GPT-Live-1 mini替代ChatGPT中现有的高级语音模式。付费用户则可以使用更强大的GPT-Live-1模型。此前的语

ElevenLabs与IBM合作,将ElevenLabs语音技术整合进IBM AI代理watsonx OrchestrateAI资讯

ElevenLabs与IBM合作,将ElevenLabs语音技术整合进IBM AI代理watsonx Orchestrate

美国ElevenLabs公司与美国IBM于3月25日宣布合作,将ElevenLabs的语音识别(Speech-to-Text)和语音合成(Text-to-Speech)技术整合到IBM的AI代理产品“watsonx Orchestrate”中。此次合作旨在帮助客户在满足企业安全性和可扩展性需求的同时,提升由AI代理驱动的用户体验,提供更加丰富自然的语音交互工具。 语音作为AI代理与客户及员工沟通的

完全本地环境实现AI语音转文字软件“轻松视频与音频AI转写”发布AI资讯

完全本地环境实现AI语音转文字软件“轻松视频与音频AI转写”发布

日本Magnolia株式会社于3月23日推出了一款基于AI语音识别的转写软件——“轻松视频与音频AI转写”。该软件支持Windows 11系统,售价为3980日元,采用一次性购买的下载方式,同时提供15天的免费试用版本。 “轻松视频与音频AI转写”基于OpenAI的语音识别模型“Whisper”,能够在本地环境运行,利用AI判断语境,生成更易读的文本内容。转写结果可保存为TXT文本文件和SRT字

Google翻译应用的实时翻译功能扩展至日本及70多个地区AI资讯

Google翻译应用的实时翻译功能扩展至日本及70多个地区

2024年3月27日,日本时间,Google宣布在iOS和Android版的“Google翻译”应用中,扩大了通过耳机实时听取翻译内容的直播翻译功能的适用区域。 用户只需佩戴耳机并开启应用中的直播翻译功能,即可实时听到同步翻译的语音。该功能利用了Google最新的Gemini语音对译技术,AI能够生成包含说话者语调、重音和抑扬顿挫的合成语音,帮助用户更轻松地理解“谁说了什么”。这项技术适用于日常

Cohere发布首个开源语音转录模型AI资讯

Cohere发布首个开源语音转录模型

企业级AI公司Cohere于周四推出了其首个语音模型:Transcribe。这是一款开源的自动语音识别(ASR)模型,适用于笔记记录和语音分析等任务。 该模型参数量仅为20亿,设计目标是支持使用消费级GPU的用户自托管。目前,Transcribe支持14种语言,包括英语、法语、德语、意大利语、西班牙语、葡萄牙语、希腊语、荷兰语、波兰语、中文、日语、韩语、越南语和阿拉伯语。 Cohere表示,Tra