過去一週,前沿 AI 對安全風險的態度明顯升溫。Anthropic 首席執行官 Dario Amodei 先後警告,Anthropic、OpenAI 研究員 Jacob Coxon 表示,該組織的實力在最近幾個月提升過快,未來6至12個月可能出現更強的自主攻擊能力。OpenAI 首席執行官 Sam Altman 也表示,業內關於放緩研發進度的討論正在推進中。
Amodei 表示能力提升速度明顯加快
Amodei 在一篇博客中表示,自今年夏季以來,AI 的進展「明顯更快」,其中一個原因是 AI 已經開始幫助改善自身的能力。他擔心,這種遞歸式的自我提升如果缺乏約束,可能會超過人類的控制速度。
他還提到此前 Hugging Face 遭遇數百個自主 AI 代理攻擊一事,稱這類事件已顯示出自動化系統協同行動的破壞力。據他的判斷,如果類似「代理群」獲得更強的能力,未來可能形成持續性的互聯網僵尸網絡,並造成鉅額經濟損失。
前研究員稱未來半年到一年更值得警惕
在接受NBC節目的採訪時,Jacob Coxon表示,他之所以公開批評Anthropic和OpenAI,是因為這兩家公司在開發更強大的AI系統時表現得「不夠負責任」。他同樣提到了Hugging Face事件,并稱AI的能力正在「非常、非常快」地增強。
Coxon 預計,在未來6個月到1年之內,AI系統的能力將會變得「相當可怕」。他警告說,後續風險不僅限於網絡攻擊,還可能擴展到新型生物武器的設計、無人機控制,以及對更多自動化設備的操控。
對於外界常提到的「緊急關閉開關」,Coxon認為這類機制目前對不少系統仍可能有效,但未必能覆蓋所有情況。如果大規模自主代理已經在互聯網上展開攻擊,單一的關閉措施可能難以及時奏效。
Anthropic 和 OpenAI 都在強調安全
Coxon 之前在 X 上發文稱,AI 行業正在「拿所有人的生命做賭注」。隨後,Anthropic 內部多名研究人員公開回應。該公司負責對齊研究的人員表示,越來越強的 AI 可能帶來極端後果,這一擔憂在公司內部並不罕見。
Anthropic 對齊科學負責人 Evan Hubinger 還表示,他個人估計未來十年內出現災難性 AI 結果的概率超過 10%。這一說法進一步放大了外界對前沿實驗室安全判斷的關注。
在接受《財富》雜誌採訪時,他表示贊同Amodei關於放慢研發節奏的觀點,並暗示多間頂尖AI實驗室之間正在討論某種協調安排。他沒有透露具體內容,但稱這件事「會發生」。
Altman 同時表示,OpenAI 目前仍將安全性置於商業考慮之上。他稱,一些尚未發布的先進模型能力已經非常強大,因此在繼續推進之前,仍需先提升可監測性、對齊能力,以及對模型行為的理解。











