AI 語音生成賽道再現大額融資。總部位於美國帕洛阿爾託的 Fish Audio 宣布完成 5,000 萬美元種子輪融資,領投方為 Coreline Ventures 和今日資本。公司表示,平台上線一年後,開源版和託管版模型用戶總數已超過 800 萬,每年經常性收入達 2,100 萬美元。
用戶與收入已形成規模
Fish Audio 主要提供語音產生和語音轉文字模型,針對創作者團隊和企業客戶。該公司稱,其產品支援超過 1.5 萬種自然語言控制,用於調節語音風格、表現力和可控性,以涵蓋內容製作、遊戲、客服和銷售等場景。
過去一年,Fish Audio 共推出 5 款模型,其中 4 款為語音產生模型,1 款為語音轉文字模型。公司已將其中 3 款語音生成模型開源,最新的 S2.1 Pro 則僅透過付費 API 提供。
- 用戶總數超過 800 萬
- 年經常性收入為 2,100 萬美元
- GitHub 上 Fish Speech 計畫獲超 3.1 萬星標
同時服務創作者與企業客戶
Fish Audio 提供按月付費方案,開放給個人創作者和團隊固定時長的語音產生額度,並提供語音克隆功能。該公司同時銷售企業版 API 和平台服務,表示 HeyGen、Sanas 和 Plaud 等機構已在使用其產品。
公司共同創辦人兼 CEO Cao 表示,不同企業對語音模型的要求並不相同。 AI 數位人公司更重視真實感,遊戲工作室更重視角色表現力,而語音代理公司則更專注於低延遲和通話中的自然度。
語音授權問題仍是產業焦點
Fish Audio 早期透過使用者上傳聲音樣本來擴充語音庫,並在聲音被使用時向提交者支付報酬。不過,數月前有創作者指稱,自己的聲音在未經同意的情況下被上傳到平台。
該公司稱,先前已設有基於 DMCA 的下架流程,但處理速度較慢。現在這項流程已自動化。創作者只需提交一段短語音樣本或相關合同,證明聲音歸屬後,平台可在 3 分鐘內完成下架。
不過,此機制仍主要用於事後處理,無法完全阻止他人在未經授權的情況下先上傳他人聲音。投資者 Coreline Ventures 也表示,社群驅動模式要長期成立,前提是創作者對平台具備足夠信任,授權、透明度、署名和清晰的授權條款都需要被納入產品設計。
資金將投向新模型研發
Fish Audio 表示,早期在開源專案和創作者訂閱業務階段,公司本身營運效率較高,對外部資金需求並不強。但隨著投資人興趣升溫,以及公司希望開發更先進模型並拓展企業市場,融資成為下一步選擇。
該公司計劃在今年推出音訊理解模型,並正在開發語音到語音模型。目前 AI 語音生成市場競爭激烈,ElevenLabs、WellSaid、Cartesia、Speechify、Async 和 Krisp 等公司都在爭奪創作者和企業預算。投資者 359 Capital 認為,更細緻的開發者控制能力和更有效率的訓練成本,將是 Fish Audio 與大型 AI 實驗室競爭的重要因素。








