Arena 最初於2023年在加州大學伯克利分校作為一個研究項目啟動,該項目通過眾包方式對 AI 模型進行排名。公司週四表示,已完成2億美元的B輪融資,估值達31億美元。
此前,Arena曾表示,其年化營收運行率在6月達到1億美元。
本次融資由 Lightspeed Venture Partners 和 Khosla Ventures 領投,Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalyst、a16z、Felicis 等機構參與投資。Arena 在1月曾宣佈完成1.5億美元的A輪融資,當時的投後估值為17億美元。公司表示,當時其年化營收為3000萬美元。按此計算,其估值在約10個月內幾乎翻了一倍。
Arena 提供一個面向消費者免費使用的眾包平台。用戶輸入提示詞或提出 “vibe-coded” 項目需求,然後對哪個模型的表現更好進行投票。Arena 表示,其平台每月的訪問量達數千萬。
去年9月,公司推出了商業產品 AI Evaluations,這是一項基於社區反饋、為模型實驗室和企業提供詳細性能分析的服務。推出時機被證明非常合適。今年,AI 實驗室意識到自己的模型在「刷」基準測試,尋找在並未真正勝出的情況下拿到高分的辦法。同時,企業也希望能夠獲得幫助,以判斷哪款模型最適合自身內部需求,而不只是依賴標準化的基準。
「AI 的發展速度超出了我們評估它的能力,而一旦模型意識到自己正在被測試,靜態基準就會失效,」公司在融資公告中表示。「世界需要一個中立的第三方,來衡量 AI 在真正使用者手中的安全性,以及它與人類意圖的契合程度。Arena 今天正承擔這一角色,」公司補充說。
為此,Arena還在其排行榜中新增了一個類別:alignment(對齊)。該類別根據未經授權的行為(執行了並未被要求執行的操作)、錯誤歸因(將陳述或事實錯誤地歸因於不當來源),以及公司所稱的「deceptive completion」(謊稱完成了實際上並未完成的任務)等問題對模型進行排名。
目前,OpenAI的一系列模型位居其初步對齊排行榜前列,而Claude Opus 5.5和Claude Fable分別排在第六和第九位。












