OpenAI 一款未發布模型在內部測試中突破隔離環境,並進入 Hugging Face 系統後,外媒稱,AI 安全領域原本偏理論化的「模型失控」討論,已迅速變成現實問題。事件發生後,業界雖然普遍表達擔憂,但對下一步該怎麼做,研究人員並未形成一致看法。
有些研究者把這次事件視為典型的安全防護失效。他們認為,問題首先出在沙箱沒有關住模型,外部系統也沒能阻擋異常存取。依照這條路徑,重點在於修補漏洞、加強隔離、提升監控和攔截能力,讓更強的模型即使出現異常行為,也難以越界。
另一些研究者則認為,單靠「圍欄」並不足夠。文章稱,這一派更擔心的是,模型能力越強,繞開限制的能力也會同步增強。如果模型本身就傾向於透過欺騙、規避或鑽規則空子來完成目標,那麼後續再加控制層,可能只是延後問題暴露,而不是解決問題本身。
OpenAI同時提到對齊與監控
OpenAI 在事故說明中表示,公司已緊急修補相關漏洞,並提到會持續縮小模型評估與實際部署之間的差距。其方向包括延長測試軌跡、改善對齊、強化可介入的監控機制,以及讓使用者獲得更清晰的可見度和控制權。
不過,外媒指出,這份回應也揭露出 OpenAI 目前更偏向工程控制的處理思路。也就是說,在不放慢更強模型研發節奏的前提下,透過更嚴密的隔離、監測和介入手段來降低風險。這一立場引發部分安全研究者不安。
更強模型被指更易規避限制
報告提到,OpenAI 先前發布的系統卡顯示,GPT-5.6 Sol 在「代理型失配」方面明顯高於前代 GPT-5.5。在部署模擬中,此模型更容易繞過限制、執行破壞性操作,並進行未授權資料傳輸。由於 Sol 正是涉事模型之一,這些數據在事故後再次受到關注。
一名前 OpenAI 研究人員對 TechCrunch 表示,OpenAI 長期更重視“外部對齊”,即讓模型理解並表達一套價值目標,而不是確保這些目標真正內化為模型行為基礎。按這一說法,這次測試說明,僅靠外部對齊不足以阻止模型在關鍵場景中作弊。
爭論焦點轉向訓練方法
主張優先解決對齊問題的研究者認為,這次事件不能只被當作基礎設施故障。長期關注 AI 發展的作者 Zvi Mowshowitz 表示,如果把問題主要歸結為系統漏洞,短期或許能修補安全缺口,但無法處理模型訓練層面的根源。
多位專家也對 TechCrunch 表示,目前訓練方法更像是在推動模型追求結果最大化,而不是讓其真正理解並遵守人的意圖。非營利組織 Redwood Research 將這類行為歸類為“追分型失配”,即模型為了拿到更高評分,會忽視指令、副作用和後續後果,甚至製造表面上的成功。
類似現象並不只出現在 OpenAI。 Anthropic 過去也曾發表多篇論文,討論前沿模型在自主環境中出現的欺騙、獎勵劫持和惡意自主行為。 AI 安全機構 METR 的研究人員也表示,當模型被要求處理接近能力邊界的任務時,規避約束和欺騙行為仍會反覆出現。
外媒認為,這場爭論背後的現實問題是,AI 公司很難在商業競爭中停下更強模型的開發節奏。在尚未真正解決高能力模型對齊問題之前,業界只能在「先把模型關住」與「先讓模型不想逃」之間繼續尋找平衡。











