AI资讯通义发布首个电影级语音合成大模型:AI终于学会带情感说话
阿里巴巴通义实验室推出Fun-CineForge,这是首个开源的多模态电影级专业配音AI模型,提升了情感表达、环境音融合和唇动同步,推动影视行业自动化进程。
按标签聚合查看文章内容。
AI资讯阿里巴巴通义实验室推出Fun-CineForge,这是首个开源的多模态电影级专业配音AI模型,提升了情感表达、环境音融合和唇动同步,推动影视行业自动化进程。
AI资讯AI生成语音模型的市场潜力巨大。创意应用需要更具表现力的AI语音模型,而企业在自动化客户支持和销售运营方面,则需要更易于控制的语音模型。 总部位于帕洛阿尔托的Fish Audio致力于满足这些多样化需求,拥有超过1.5万个自然语言控制指令的语音库。自去年推出以来,该初创公司已有超过800万人使用其开源或托管版本的模型,年经常性收入达到2100万美元。 为了进一步扩大影响力,Fish Audio于周
AI商业Speaktor 是一款基于 AI 的文本转语音(TTS)工具,可将文字内容快速转换为自然流畅的语音,支持 50+ 种语言,适合听文章、做配音与提升内容可访问性。
AI资讯美国微软公司于7月23日(当地时间)宣布推出两款新AI模型:“MAI-Image-2.5-Pro”和“MAI-Voice-2-Flash”,均作为其自主开发的AI模型系列“MAI”的新成员,以公开预览形式提供。 MAI-Image-2.5-Pro “MAI-Image-2.5-Pro”是一款专注于图像质量的生成与编辑模型,适用于对图像清晰度要求极高的应用场景。该模型是微软目前最高精度的图像生成模
AI视频Papercup 是面向企业与内容创作者的 AI 配音与语音本地化平台,将专利级合成语音技术与专业配音团队相结合,提供端到端的多语言配音、翻译与音频本地化服务,帮助视频和音频内容快速进入全球市场。
AI资讯美国ElevenLabs公司与美国IBM于3月25日宣布合作,将ElevenLabs的语音识别(Speech-to-Text)和语音合成(Text-to-Speech)技术整合到IBM的AI代理产品“watsonx Orchestrate”中。此次合作旨在帮助客户在满足企业安全性和可扩展性需求的同时,提升由AI代理驱动的用户体验,提供更加丰富自然的语音交互工具。 语音作为AI代理与客户及员工沟通的
AI资讯Google最新文本转语音模型Gemini 3.1 Flash TTS发布,支持多语言和多说话人,提升音质与表达能力。
AI资讯AI技术让已故漫威传奇斯坦·李“复活”,但引发伦理争议。
中国AI公司MiniMax将其语音与音乐模型深度整合进OpenClaw“螃蟹”插件,赋予其语音交互和音乐创作能力,提升沟通体验。
AI资讯松下推出搭载AI功能的无线监控门铃,结合AITalk micro语音合成引擎,实现来访者身份识别与自动语音应答。
AI资讯Google为Google Vids的AI语音引擎新增了30种丰富表达力的对话音色,支持24种语言。
AI资讯阿里巴巴通义实验室推出Fun-CineForge,一款开源的AI配音大模型,突破了唇动同步、情感表达及多角色声音一致性等核心难题,并公开了高质量数据集构建方法。