AI资讯OpenAI发布全新语音模型,实现更自然的实时对话体验
OpenAI今日推出了全新的对话语音模型,名为GPT-Live-1和GPT-Live-1 mini,声称这些模型的语音更加自然,且在对话轮换上表现更佳。这些模型支持全双工功能,意味着它们可以同时说话和聆听,允许用户自然打断对话,并支持实时翻译等功能。 公司还宣布将默认用GPT-Live-1 mini替代ChatGPT中现有的高级语音模式。付费用户则可以使用更强大的GPT-Live-1模型。此前的语
按标签聚合查看文章内容。
AI资讯OpenAI今日推出了全新的对话语音模型,名为GPT-Live-1和GPT-Live-1 mini,声称这些模型的语音更加自然,且在对话轮换上表现更佳。这些模型支持全双工功能,意味着它们可以同时说话和聆听,允许用户自然打断对话,并支持实时翻译等功能。 公司还宣布将默认用GPT-Live-1 mini替代ChatGPT中现有的高级语音模式。付费用户则可以使用更强大的GPT-Live-1模型。此前的语
AI资讯Givery AI是一款专为企业设计的AI录音设备,能够将会议和现场音频实时转化为可利用的数据,支持自动生成会议纪要,助力知识管理。
AI资讯CoeFont推出了专为日本人英语发音特点设计的AI语音识别调校功能,提升了翻译准确率。
AI资讯美国ElevenLabs公司与美国IBM于3月25日宣布合作,将ElevenLabs的语音识别(Speech-to-Text)和语音合成(Text-to-Speech)技术整合到IBM的AI代理产品“watsonx Orchestrate”中。此次合作旨在帮助客户在满足企业安全性和可扩展性需求的同时,提升由AI代理驱动的用户体验,提供更加丰富自然的语音交互工具。 语音作为AI代理与客户及员工沟通的
AI资讯日本Magnolia株式会社于3月23日推出了一款基于AI语音识别的转写软件——“轻松视频与音频AI转写”。该软件支持Windows 11系统,售价为3980日元,采用一次性购买的下载方式,同时提供15天的免费试用版本。 “轻松视频与音频AI转写”基于OpenAI的语音识别模型“Whisper”,能够在本地环境运行,利用AI判断语境,生成更易读的文本内容。转写结果可保存为TXT文本文件和SRT字
AI资讯OpenAI在Realtime API中新增三款音频模型,助力开发者打造更自然智能的实时语音体验。
AI资讯微软发布三款全新AI模型,涵盖语音、文本转录及图像生成,展示其在AI领域的多元化布局。
AI资讯Cohere于2026年3月26日推出了开源语音识别模型Cohere Transcribe,拥有20亿参数,专为边缘设备设计,解决大型语音模型带来的延迟问题。该模型支持14种语言,性能超越主流竞争对手,旨在通过开发者社区推动生态发展并实现商业化。
AI资讯YScope推出的AI智能录音笔Comulytic Note Pro,在亚马逊Prime Day期间限时9折促销,售价20700日元。
AI资讯2024年3月27日,日本时间,Google宣布在iOS和Android版的“Google翻译”应用中,扩大了通过耳机实时听取翻译内容的直播翻译功能的适用区域。 用户只需佩戴耳机并开启应用中的直播翻译功能,即可实时听到同步翻译的语音。该功能利用了Google最新的Gemini语音对译技术,AI能够生成包含说话者语调、重音和抑扬顿挫的合成语音,帮助用户更轻松地理解“谁说了什么”。这项技术适用于日常
AI资讯多模态AI能够综合处理文字、图像、音频和视频等多种信息形式,推动AI从单纯的文本生成工具向多信息融合处理工具转变。
AI资讯企业级AI公司Cohere于周四推出了其首个语音模型:Transcribe。这是一款开源的自动语音识别(ASR)模型,适用于笔记记录和语音分析等任务。 该模型参数量仅为20亿,设计目标是支持使用消费级GPU的用户自托管。目前,Transcribe支持14种语言,包括英语、法语、德语、意大利语、西班牙语、葡萄牙语、希腊语、荷兰语、波兰语、中文、日语、韩语、越南语和阿拉伯语。 Cohere表示,Tra