Clockwork.io 融資3100萬美元
— Clockwork.io 融資3100萬美元;LinkedIn、Together AI 和 WhiteFiber 采用其容錯軟件,以避免 GPU 小時的浪費
LinkedIn 每月可避免數萬小時的 GPU 停機;TorchPass 的新創新可在不修改代碼的情況下保留 AI 工作負載進度,並加速強化學習。
美國加州帕洛阿爾托,2026年10月5日 / PRNewswire / — 為了為 AI 的訓練、強化學習和推理工作負載在基礎設施故障時維持運行而提供容錯軟件,供應商 Clockwork.io 今日宣佈獲得3100萬美元的新融資,並在 LinkedIn 和 Together AI 完成生產部署,同時 WhiteFiber 进一步擴大採用。
公司還發布了 TorchPass 解決方案的兩項新功能,每一項都能捕獲正在運行的分散式 AI 任務狀態。多模式平台快照是訓練領域的行業創舉,可以在不需修改訓練代碼的情況下保存所有節點上的完整任務,並在之後恢復。快速異步應用檢點則在任務運行時於後台執行,可以加速強化學習。它們會將更新後的模型權重提供給負責生成 rollouts 的推理副本,也就是模型學習所依據的樣本,從而讓這些副本減少等待時間,或避免使用過時模型工作。
容錯已經成為大規模 AI 的基本要求
大型分散式 AI 工作負載可能橫跨數千塊 GPU,這些 GPU 必須保持同步:單塊 GPU 故障、鏈路中斷或伺服器宕機都可能讓整個任務停擺。 Meta 曾報告稱,在使用16,384塊 GPU 進行 Llama 3為期54天的訓練期間,意外中斷平均約每三小時發生一次。
通常的應對方式是重新載入檢查點,也就是任務進度的保存副本。恢復過程最長可達90分鐘,這會讓正常運行的 GPU 陷入閒置狀態,並迫使系統從檢查點處重複已經完成的工作。客戶為了這段閒置時間和重複計算付出代價,模型完成時間也會更長。隨著任務規模的擴大,每次重新啟動都會讓更多 GPU 的使用時間面臨風險。
在這樣的規模下,即便發生故障也必須保證工作能持續進行,這已經成為基礎設施的必要要求。Clockwork.io 透過一套容錯工具來滿足這一需求,平台團隊將其作為硬體與工作負載之間的中介層進行部署。LinkPass 會重新導向流量以避開故障鏈路,讓任務甚至無法察覺到故障的存在。TorchPass 則可以將工作負載從發生故障的 GPU 迷移至正常的 GPU,從而讓訓練不需要回退到更早的狀態就能繼續進行。這兩項方案目前都已進入生產階段。公司今日宣布的 TorchPass 平臺新功能可以捕捉正在運行中的分散式任務的狀態;當故障嚴重到無法通過簡單的遷移來解決時,這一功能可以用來恢復整個任務。
「在 AI 的規模下,故障難以避免;但因此而損失數小時的有效工作是不應該發生的,」Clockwork.io 的執行長 Suresh Vasudevan 表示,「容錯就如同一個有效的性能放大器:它讓 GPU 可以繼續進行富有生產力的工作,而不是等待恢復流程或重複已經完成的任务。我們與運營著一些最大 GPU 集羣的企業和雲服務供應商合作開發軟件,因此它能夠處理他們實際遇到的故障。這種保護應當成為這些企業和服務供應商日常依賴的基礎設施的一部分。」
適用範圍擴大至企業、超大規模雲端和 neocloud
自建 GPU 集群的企业、超大规模云厂商以及 “neocloud” 提供商出於相同的原因採用 Clockwork.io:讓更多 GPU 小時用於有效工作。
LinkedIn 已在其 AI 基礎設施上全栈部署 LinkPass 網路容錯能力,從而每月避免數萬小時的 GPU 停機時間。
LinkedIn 基礎設施高級副總裁兼首席技術官 Raghu Hiremagalur 表示:「在 AI 的基礎設施規模下,單一網絡問題絕不應該讓正常運作的 GPU 下線,或中斷正在運行的工作負載。在採用 Clockwork.io 之前,InfiniBand NIC 的抖動可能會讓一臺配備了8塊 GPU 的服務器退出服務,而交換機端口的抖動又可能讓第二台服務器失效,使得影響翻倍至16塊 GPU。Clockwork.io 幫助改變了這種運營模式。其網絡容錯技術會自動將流量重定向到可用路徑,讓任務在鏈路、光學組件、線纜或網卡故障修復期間持續運行。總體而言,Clockwork.io 每月為我們的整個集羣避免了數萬小時的 GPU 停機。它把原本破壞性的運營事件轉變爲可管理的維護事件,幫助提升了基礎設施利用率和運營效率。」
Together AI 正在將 TorchPass 作為其 GPU 集群上的服務推向市場。雙方將在 PyTorch 大會期間現場演示一項多節點訓練任務,即使故意引入網絡和 GPU 故障,該任務也能持續運行而無需重新啟動。
「客戶評估我們的標準是 goodput,也就是在 GPU 小時內真正推動模型進展的比例,」 Together AI 產品負責人 Pavneet Ahluwalia 表示,「節點修復功能已經可以自動檢測故障並調配替代容量。 Clockwork.io 的 TorchPass 和 LinkPass 是建立在此基礎設施之上,旨在讓任務在 GPU 和鏈路故障下仍能繼續執行,從而保留已取得的進展。我們正將它們作為平台下一層的容錯能力推向市場。」
WhiteFiber(NASDAQ:WYFI)是該公司的現有客戶,他們正在不斷擴大的全球GPU(即服務基礎設施)中,更廣泛地使用Clockwork.io軟件。
WhiteFiber 首席技術官 Tom Sanfilippo 表示:「在集羣投入生產之前,對其可靠性進行壓力測試至關重要,因為如果客戶收到一個存在隱藏互連網絡故障的系統,最終將以失敗的任務和損失的 GPU 小時來承擔後果。質量一般的光學組件、配置不當的網卡(NIC),以及在基礎測試中通過但在負載下退化的鏈路,都可能被忽視。Clockwork.io 的自動化集羣審計會同時驗證每條鏈路和每個節點,在幾分鐘內定位故障,並讓我們在交付前修復它們。我們能更快地啟動集羣,因此客戶的首次訓練運行是在經過端到端驗證的網路上進行,而不是僅僅在一個已開機的系統上進行。鑑於市場需求迅猛,快速向客戶交付經過驗證的容量對我們的業務至關重要;因此我們正在所有集羣中部署 Clockwork.io。」
TorchPass的新功能將工作負載保護交給平臺團隊
Clockwork.io 已將 TorchPass 的功能從 GPU 遷移擴展到兩項平臺團隊此前不具備的功能:平臺團隊可自行生成整個分散式任務的快照,以及足夠快速、可在後台運行的應用檢點。
在訓練場景中,平台快照會保存正在所有節點上運行的任務的執行狀態,從而可以在中斷後恢復任務。平台團隊和 AI 基礎設施工程師可以將該方案部署到兼容的工作負載上,而無需應用所有者修改代碼或增加檢查點邏輯。企業團隊可以通過單一機制保護整個機羣中的訓練任務,雲服務供應商也可以保護其無法控制代碼的客戶任務。當團隊在應用層實施檢查點時,TorchPass 的快速檢查點能力可以讓檢查點更頻繁地執行;這樣在故障後丟失的進度就更少,需要重複的計算工作也更少。
在推理方面,大模型通常運行在兩台或更多伺服器上,因此鏈路故障可能會讓整個複本失效,並在用戶會話或代理任務進行中將其打斷。LinkPass 可以讓這些多伺服器複本在鏈路故障下繼續運行。
強化學習同時依賴於訓練和推理。多個模型副本生成 rollouts,訓練系統從中學習,更新後的權重必須先返回到這些副本,副本才能使用最新版本生成結果。TorchPass 的應用檢點可以更快地將更新後的權重傳回執行副本,而 LinkPass 則讓這些副本在鏈路故障下保持運行。
SemiAnalysis 的創始人、執行長兼首席分析師 Dylan Patel 表示:「集羣容錯過去只是訓練方面的問題;現在也成為了推理方面的問題。根據我們對 ClusterMAX 的測試,在一家獲得『金牌』評級的 neocloud 提供商那裡,TorchPass 將訓練期間的有效性能損失從14%降至不到3%。強化學習(RL)將這兩個過程連接起來:推理副本生成模擬,訓練系統從中學習,更新後的權重再返回副本。Clockwork.io 使副本能夠在鏈路波動和網絡故障下繼續運行。其超快速檢點還能加速權重回傳到推理集羣,避免流程在任一方向停滯。該方案需要作為訓練、推理和強化學習通用的容錯層來部署。」
企業平臺團隊和雲服務供應商可聯絡 Clockwork.io,評估其軟件在各自工作負載中的應用,或探討合作機會。
融資輪次及資金用途
本次融資由 Premji Invest、Wing Venture Capital 和 Seligman Ventures 共同領投,現有投資者 NEA 和 e& Capital 也參與其中。至此,Clockwork.io 的累計融資金額達到 7,300 萬美元。公司將利用這筆資金加速其容錯工具套件的部署——適用於訓練、推理和強化學習階段——擴大企業採用範圍,并通過雲服務合作夥伴來擴大交付規模。
「唯一能完美擴展的就是不可靠性:只要在一台機器上安裝足夠的 GPU,總會有問題發生,」 NEA 的風投合夥人 Greg Papadopoulos 表示,「傳統的方法——停止任務並重新載入檢點——在當今的規模下已經沒有意義了。 Clockwork 將故障視為常態: TorchPass 可以將訓練實時從出錯的 GPU 遷移出來,現在還可以在不需修改代碼的情況下捕捉到整個運行中任務的狀態。它已經每月節省了數萬小時的 GPU 時間。我們在2021年就投資了 Clockwork.io,並很高興繼續支持他們定義 AI 集羣的性能層。」
關於 Clockwork.io
Clockwork.io 是 Software - Driven AI Fabrics ™ 的先驅,這是一層位於硬體與工作負載之間的可編程層,能讓 GPU 集羣具備可觀測性、容錯能力,並最大化利用率,而不受所使用的加速器、網路或雲環境的影響。AI 工作負載要求整個集羣像一臺機器一樣運行;然而,故障和瓶頸會讓 GPU 闲置。Clockwork 的 FleetLens 平臺能恢復這部分損失的能力:藉助納秒級的遙測,它能精確識別是哪塊 GPU、哪個節點或哪條鏈路在拖慢或阻塞任務,並在上线前驗證集羣。此外,通過 LinkPass 和 TorchPass,它能確保從訓練到推理的工作負載即使在基礎設施故障或退化時也能持續運行。根據 SemiAnalysis 進行的獨立基準測試,TorchPass 在故障恢復速度方面優於主要的開源框架以及傳統的檢查點和重新啟動方法。LinkedIn、Together AI、WhiteFiber、Wells Fargo、Nebius、NScale 和 DCAI 等公司都在使用 Clockwork.io 推動他們的 AI 基礎設施。更多信息請訪問 www.clockwork.io。










