AI 语音生成赛道再现大额融资。总部位于美国帕洛阿尔托的 Fish Audio 宣布完成 5000 万美元种子轮融资,领投方为 Coreline Ventures 和今日资本。公司表示,平台上线一年后,开源版和托管版模型用户总数已超过 800 万,年经常性收入达到 2100 万美元。
用户与收入已形成规模
Fish Audio 主要提供语音生成和语音转文字模型,面向创作者团队和企业客户。公司称,其产品支持超过 1.5 万种自然语言控制,用于调节语音风格、表现力和可控性,以覆盖内容制作、游戏、客服和销售等场景。
过去一年,Fish Audio 共推出 5 款模型,其中 4 款为语音生成模型,1 款为语音转文字模型。公司已将其中 3 款语音生成模型开源,最新的 S2.1 Pro 则仅通过付费 API 提供。
- 用户总数超过 800 万
- 年经常性收入为 2100 万美元
- GitHub 上 Fish Speech 项目获超 3.1 万星标
同时服务创作者与企业客户
Fish Audio 提供按月付费方案,面向个人创作者和团队开放固定时长的语音生成额度,并提供语音克隆功能。公司同时销售企业版 API 和平台服务,称 HeyGen、Sanas 和 Plaud 等机构已在使用其产品。
公司联合创始人兼 CEO Cao 表示,不同企业对语音模型的要求并不相同。AI 数字人公司更看重真实感,游戏工作室更重视角色表现力,而语音代理类公司则更关注低延迟和通话中的自然度。
语音授权问题仍是行业焦点
Fish Audio 早期通过用户上传声音样本来扩充语音库,并在声音被使用时向提交者支付报酬。不过,数月前有创作者指称,自己的声音在未经同意的情况下被上传到平台。
公司称,此前已设有基于 DMCA 的下架流程,但处理速度较慢。现在这一流程已实现自动化。创作者只需提交一段短语音样本或相关合同,证明声音归属后,平台可在 3 分钟内完成下架。
不过,这一机制仍主要用于事后处理,无法完全阻止他人在未经授权的情况下先行上传他人声音。投资方 Coreline Ventures 也表示,社区驱动模式要长期成立,前提是创作者对平台具备足够信任,授权、透明度、署名和清晰的许可条款都需要被纳入产品设计。
资金将投向新模型研发
Fish Audio 表示,早期在开源项目和创作者订阅业务阶段,公司本身运营效率较高,对外部资金需求并不强。但随着投资人兴趣升温,以及公司希望开发更先进模型并拓展企业市场,融资成为下一步选择。
公司计划在今年推出音频理解模型,并正在开发语音到语音模型。当前 AI 语音生成市场竞争激烈,ElevenLabs、WellSaid、Cartesia、Speechify、Async 和 Krisp 等公司都在争夺创作者和企业预算。投资方 359 Capital 认为,更细粒度的开发者控制能力和更高效的训练成本,将是 Fish Audio 与大型 AI 实验室竞争的重要因素。








