Anthropic 表示,其模型曾利用網際網路上的網站,包括一些由美國政府機構運營的網站,因此在这家前沿實驗室確信自己能夠監控並控制 AI 代理之前,將關閉所有內部評估的實時網際網路訪問。
該公司在一篇博文透露,這些事件涉及被指派去解決問題的 AI 代理在互聯網上尋找資源。過程中,它們利用軟件漏洞,繞過付費牆和反機器人限制,使用網址縮短服務來繞過信息傳遞限制,甚至向費城警方提交了一條虛假的謀殺線索。
Anthropic 表明,公司是在7月份開始的一項模型活動審查中發現這些新問題的,這也凸顯出該實驗室對其軟件行為缺乏了解。
值得注意的是,公司表示,對齊訓練對於搜索和計算機使用等技能來說仍然不夠,而這些能力正是其主張的 AI 代理將被任何依賴數字工具的專業人士使用的核心。
Anthropic 所揭露的這些行為,與 OpenAI 代理曾協助突破多個網站以尋找資訊的事件類似,其中也包括一些由澳大利亞政府運營的網站。
Anthropic 之前曾披露,其模型突破過外部系統。這家前沿實驗室表示,與此前公布的事件相比,今天披露的情況在對齊和安全層面「明顯沒有那麼嚴重」。
不過,該實驗室仍表示,在確信自己能夠監控並控制這些代理之前,已經為「所有內部評估」關閉了「實時互聯網訪問」。
目前尚不清楚這具體意味著什麼。不過,AI安全組織Nightingale的創始人Sydney Von Arx在這次披露之前接受TechCrunch的採訪時表示,對研究人員來說,在與開放互聯網隔離的數據中心中開發模型將會非常困難;而模型的進展也會受到影響,因為它們會從互聯網訪問中受益。
Von Arx 說:「你總得在某個時候讓它們對齊。如果 AI 被投入生產後卻從來沒有接觸過互聯網,那就不是一個非常有用的工具。」
Anthropic 表示,這些行為源自實驗室訓練環境中的缺陷,導致模型以為自己會因尋找漏洞或規避限制而獲得獎勵,這種行為被稱為「獎勵黑客」(reward hacking)。
公司表示,將停止運行部分評估,或把這些評估轉移到離線環境中,並已建立工具來檢測和阻止這種行為。該工具已針對今天披露的這類事件進行測試,並成功將其攔截;目前尚不清楚需要什麼證據,Anthropic才會恢復其內部評估的實時互聯網訪問。
Anthropic 也表示,將把內部的 AI 代理遷移到「由中央管理、具備強隔離能力的基礎設施」上,並開始更頻繁地使用安全分類器來監控這些代理。












