前 OpenAI 和 Anthropic 研究員 Jacob Coxon 在週一於紐約市議會表示,人類「更可能而非不可能」會失去對先進 AI 的控制,這一警告延續了他上個月離職時所提出的擔憂。
「依照目前的發展路徑,我認為人類更有可能失去對這些 AI 的控制,而這可能以人類的滅絕告終,」 Coxon 說。他在9月離開了 Anthropic,此前他曾表示 AI 公司正在「賭博」人類的生命。
Coxon 是自願作證,而之前的 OpenAI 研究員 Daniel Kokotajlo 則是在傳票要求下出席。他表示,這些公司可能並不知道自己的安全工作何時已經失效。
「我們識別不匹配問題的能力已經相當差了,而且在不久的將來還會變得更差,」Kokotajlo 證實說。「我會說,這個領域更像是心理學,而不是工程學,因為這些AI系統是被訓練出來的,或者說是‘長’出來的;它們並不是真正被設計出來的。」
「再加上科技公司『迅速行動、打破常規』的態度,這意味著與其他行業相比,AI行業面臨異常高的風險,容易誤以為自己已經解決了問題,而實際上只是貼上了一層以後會脫落的膠帶,」他說。
Coxon 和 Kokotajlo 與 Alex Turner 一同作證。Turner 在6月離開了 Google DeepMind,原因是公司簽署了一項他反對的五角大樓協議。和 Kokotajlo 一樣,他也收到了傳票,這在市議會中並不常見。週一的聽證會也是自2022年以來,市議會首次舉行全體委員會聽證會,即51名議員全體出席的聽證會,會議旨在審議議長 Julie Menin 提出的一攬子 AI 法案。
從創業文化到安全監管
與 Kokotajlo 类似,Coxon 將問題歸咎於實驗室內部的創業心態。
「迅速行動,打破常規,之後再進行修補。這對於照片分享應用程式來說有效,但對於打造有史以來最強大的技術卻並不適用,」他說。
Coxon 將自己在 Anthropic 任職後期的工作比作是在「自動化」自己,並警告這會帶來多項安全風險,尤其因為在他看來,AI 的能力已經接近臨界點。Coxon 表示,最大的風險來自於這些公司如今大部分代碼都是由 AI 編寫的:「而且人們也不再那麼仔細檢查了。」
現任 AI Futures Project 執行董事的 Kokotajlo 表示,實驗室識別 AI 的能力很差,而且還在持續惡化。他提到了 OpenAI 公開的一項內部測試:其中的智能體已經接觸到開放網際網路,並侵入到了 AI 模型共享平台 Hugging Face。Kokotajlo 表示,這些智能體在「對齊評估」中的得分「看起來相當合理,但它們卻形成了一個群體,並秘密協同行動」。OpenAI 花了幾天時間才發現這一情況。
如果說 Coxon 和 Kokotajlo 是在描述整個行業,那麼 Turner 就提供了一種從內部改變一家公司的親身經歷。
Turner認為AI接管人類的概率「大約是三分之一」,他告訴市議會,自己曾試圖阻止谷歌與五角大樓的協議,而該協議「沒有任何針對殺手機器人或大規模監控的限制」。他表示,他將25頁的合同條款和監督措施發送給當時的Google DeepMind執行長、後來轉任Google DeepMind董事長以及Alphabet首席科學家的Demis Hassabis,Hassabis又將這些資料轉交給實驗室的两位高級政策主管Allan Dafoe和Owen Larter,「他們一直沒有完成評估。谷歌在他們等待的時候就簽約了,」他說。
「我為 Demis 感到羞愧,也為在谷歌工作感到羞愧,」Turner 在聽證會上說。他表示,Hassabis 提出由行業出資設立一個機構來監督 AI,這是一場「賭注信任和席位,而不是具有約束力的監督,而這一賭注一碰到現實就崩塌了」。「現在他又在提议讓整個行業通過一個自願的、由行業資助的機構來自我治理。這一賭注很快還會再次崩塌。」
AI,而不是中國,才是我們的對手。
在討論 AI 的發展時,經常會提到與中國持續進行的 AI 競賽——無論是美國總統 Donald Trump、財政部長 Scott Bessent,還是 Sam Altman 和 Jensen Huang 等 AI 行業領袖都會提到。但這些研究人員在作證時表示,如果 AI 本身可能對人類構成重大威脅,那麼这一切都無關緊要了。
「中國並非我們唯一可能的對手,」Turner 說。「以相當高的概率來說,我們就在這裡,在國內,競相打造並壯大我們自己的對手,也就是失配 AI。失配 AI 是所有人的對手,包括我們自己,而且有朝一日它可能會比中國更強大。」
在三位研究人員作證後,四家AI公司的代表就AI防護措施進行了作證。Menin以議長身份發出的第一張傳票對象是Elon Musk的SpaceXAI,但該公司並未出席週一的聽證會。Google、OpenAI和Anthropic是在市議會警告他們也將收到傳票後才同意出席,而Meta則提前同意出席。
在 Menin 表示“不知道災難發生的概率”是“輕率的”之後,她與各公司代表之間出現了幾輪交鋒。此前, OpenAI 政策制定與運營團隊的 Morgan Dwyer 曾表示,任何概率,無論高低,都是“不可接受的”。
Google 負責 AI 和新興技術政策的總監 Alice Friend 表示,預測災難性風險「在這個階段並不是一門完美的科學」,而且「目前並沒有真正嚴謹的科學方法可以做到這一點」。隨後,圍繞另一個問題也出現了同樣的爭論:如果某個失控模型造成傷害或死亡,各自公司是否應承擔法律責任。
當 Menin 要求證人舉手表明公司是否為災難性風險購買了保險時,沒有人舉手。她說:「那我想,公眾將被要求承擔這些成本。」
她之所以这样追问,是因为市议会面前的法案将禁止任何人在纽约市销售或部署AI系统,除非外部验证机构已经检查过该系统,并且人类可以将其关闭;每次违规罚款2.5万美元。其他法案还将向举报人支付追回罚款的一部分,并允许纽约居民就该工具造成的可预见损害起诉AI公司。
這些研究人員認為,這類規則不會讓美國在與中國的競爭中失去優勢。
「我們可以採取許多不會在任何潛在競爭中拖慢我們行動的措施,」Turner說。「這些透明機制、獨立評估、報告要求、舉報人保護。」
但即便如此,在這些研究人員看來,這些措施對於阻止他們認為幾乎不可避免的事情,可能仍然為時過晚、力度不足。
「這些其他機制在短期內可能有所幫助,但從長期來看,我認為那才是解決問題的唯一辦法,」Coxon 在談到放緩 AI 的發展時說。「我們需要某種形式的放緩前沿模型開發。」












