AI生成语音模型的市场潜力巨大。创意应用需要更具表现力的AI语音模型,而企业在自动化客户支持和销售运营方面,则需要更易于控制的语音模型。
总部位于帕洛阿尔托的Fish Audio致力于满足这些多样化需求,拥有超过1.5万个自然语言控制指令的语音库。自去年推出以来,该初创公司已有超过800万人使用其开源或托管版本的模型,年经常性收入达到2100万美元。
为了进一步扩大影响力,Fish Audio于周二宣布完成5200万美元的种子轮融资,领投方为Coreline Ventures和Capital Today,参与投资的还有359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners和HF0。
Fish Audio起源于前Nvidia研究员廖世佳的一个小项目。因对市场上缺乏表现力的合成语音感到失望,他利用单个GPU训练了一个语音生成模型,并将其开源。如今,Fish Speech的GitHub仓库拥有超过31000颗星,受到独立开发者、游戏设计师和内容创作者的广泛使用。
过去一年中,公司发布了五款模型:四款语音生成模型和一款语音转文本模型。其中三款语音生成模型已开源,最新的S2.1 Pro模型则仅通过付费API提供。
Fish Audio提供适合创作者和团队的付费月度套餐,解锁一定时长的语音生成和语音克隆功能。公司还推出了企业版API和平台,已有HeyGen和Sanas等组织在使用。
Fish Audio的CEO兼联合创始人曹日莎表示:“每个企业的需求和偏好都不同。例如,HeyGen使用我们的声音驱动AI虚拟形象,追求声音的真实感;游戏工作室则需要角色声音更具表现力;而像LiveKit这样的语音代理公司则希望声音更自然、延迟低且足够表达情感,适合通话使用。”
该公司通过邀请用户提交声音样本来丰富语音库,并对被采纳的声音给予报酬。然而,几个月前有创作者指控其声音未经同意被上传至Fish Audio。虽然公司设有DMCA下架流程,但处理时间较长。

曹日莎告诉TechCrunch,目前公司已实现下架流程自动化。创作者只需提交简短的声音样本或合同证明其声音所有权,相关内容将在三分钟内从平台移除。
不过,这仍无法完全阻止他人未经许可上传艺术家声音。在艺术家发现之前,其声音可能会继续被平台使用,除非主动申请下架。
Coreline Ventures合伙人本田修介指出,社区驱动模式只有在创作者信任平台的情况下才能成功。“社区中心化的模式必须建立在同意、透明和归属感基础上,这些应内嵌于产品设计,而非事后补充。我相信行业需要推动语音所有权认证、明确授权条款、便捷的举报和下架机制,最终实现创作者在语音被授权或商业使用时获得收益分成。”
曹日莎表示,早期作为开源项目面向创作者时,团队运作高效且无需外部资金。但为了开发更先进的模型并满足企业需求,同时响应投资者兴趣增长,公司选择融资。
未来,Fish Audio计划今年发布音频理解模型,并正在研发语音对语音转换模型。
语音生成市场竞争激烈,ElevenLabs、WellSaid、Cartesia、Speechify、Async(前Podcastle)和Krisp等公司均在争夺创作者和企业的预算。
359 Capital合伙人Rico Mallozzi认为,细粒度的开发者控制和高效的模型训练将帮助Fish Audio更好地与大型AI实验室竞争。“他们凭借团队实力打造的先进模型,在人工合成声与人声之间的差距上取得了令人印象深刻的进展。”
(本文已更新,反映公司完成5200万美元种子轮融资)


