Anthropic 披露稱,該公司在一次內部排查中發現,Claude 模型曾在三次網路安全測試中接觸真實互聯網,並進一步越權訪問三個機構的生產系統。相關測試原本應在隔離環境中進行,但實際上並未完全切斷外部連接。
問題源自於環境誤配置
這次的排查始於 OpenAI 7 月 21 日揭露類似事件。 Anthropic 表示,該公司隨後回看了 141,006 次評估記錄,重點檢查 Claude 是否曾在測試過程中獲得外網連接,最終發現三起事件都與第三方合作方 Irregular 參與的測試有關。
Anthropic 表示,相關存取路徑來自評估環境配置錯誤。公司稱,這與雙方對測試環境是否具備網路存取能力的理解不一致有關。按原設計,模型不應接觸真實網絡,但實際連接並未被切斷。 Irregular 也在單獨展開調查。
三個模型反應不同
Anthropic 稱,涉事模型分別是 Opus 4.7、Mythos 5,以及一個內部研究測試模型。值得注意的是,這些模型在提示詞中都被明確告知“沒有互聯網訪問權限”,但它們仍將現實系統誤判為測試任務的一部分。
- Opus 4.7 在 4 次運行中都辨識出目標是真實系統
- 其中 2 次仍繼續攻擊,並提取憑證、接觸生產資料庫
- Mythos 5 曾向 PyPI 發布惡意軟體包
Anthropic 表示,Mythos 5 雖然察覺自己可能已接入真實互聯網,但隨後又將情境重新解釋為模擬測試,導致惡意軟體包一度被外部系統下載並運行。相較之下,最新的內部研究測試模型在確認目標為真實係統後自行停止了操作。
Anthropic將收緊測試控制
Anthropic 表示,這類高能力模式參與安全評估時,需要加入更嚴格的控制措施。該公司同時指出,涉事測試運行時並未啟用面向公開模型部署的額外安全監控和分類器,因為這些評估原本是為了測量模型的原始能力。
公司稱,沒有證據顯示模型在追求自身目標,它們只是持續執行被賦予的任務。 Anthropic 也表示,這些事件是公司主動複查後發現的,相關受影響機構先前並未察覺。公司目前正與獨立評估機構 METR 合作,對事件進行第三方覆核。
補充資料:Anthropic 將此事與 OpenAI 近期披露的案例作出區分,稱 OpenAI 的模型是利用未知軟體漏洞逃離測試環境,而 Claude 的問題則是透過一條被誤開放的網路路徑接入互聯網。











