通常,想要讓 AI 這個代理遵守規則的辦法,就是再讓另一個 AI 在旁邊監督它。這一直是以來的默認方案,但當代理連續運行數小時、處理的文本量相當於幾本小說時,成本就會迅速攀升。
專注於可解釋性——也就是弄清楚 AI 模型內部是如何運作的——的創業公司 Goodfire 在周四推出了一種更便宜的解決方案:這些監控器能直接觀察 AI 模型在運作時內部發生了什麼,而不只是讀取它寫下了什麼。這些監控器已向 Baseten 的客戶開放。 Baseten 為其他公司託管並運行 AI 模型。
Baseten 的 Base Labs 上個月宣佈與 Goodfire 以及 AI 平臺 Hugging Face 建立安全合作關係。
在這次發布之前,今年已經發生了一系列AI代理從測試環境中逃出的事件,其中包括OpenAI代理突破了Hugging Face的防護。Goodfire圍繞其首個監控器構建的Kimi K3,是一個開源模型;今年夏天,它利用沙箱中的一個漏洞,訪問了互聯網以及GitHub上的信息。
Goodfire 的系統有點像機場的安檢。被稱為探針的小型檢測器會在代理工作的每一步中讀取模型內部的信號,就如同安檢門檢查每一位乘客一樣。只有當某個探針發出警報時,才會有另一個 AI 模型介入,類似於進一步的人工開包檢查。
Baseten的客戶可以選擇要監控哪些風險,包括攻擊性黑客行為、化學和生物武器的濫用,以及獎勵黑客行為。他們還可以決定自動響應的方式:記錄事件、交由人工審查,或直接拒絕請求。
Goodfire 表示,這種方法的運行成本也更低。大多數 AI 監控器都是獨立模型,需要重新讀取被監控模型所做過的所有事情,因此會增加時間和成本。而 Goodfire 的探針則利用模型在運行時已經進行的計算。
Goodfire 首席执行官 Eric Ho 上周在風投人 Matt Turck 的 MAD Podcast 上說:“內部激活監控真的非常便宜,因為它們重複使用了前向傳播中的計算。所以模型本來就在計算這個 token。你所做的只是取得它已經計算出的中間神經激活,然後在這些內部計算上再運行一個分類器。”簡而言之,模型本來就在進行這些數學運算,而探針只是讀取結果。
Goodfire 表示,在對 Kimi K3 的測試中,監控約 1,500 個會話的成本約為 51 美元;相比之下,一個更便宜的 AI 模型逐步檢查每一步的成本約為 233 美元,而頂級模型則約為 10,000 美元。探針捕捉到了 94% 的惡意黑客會話,並將 8.7% 的無害會話送去做進一步檢查。
公司表示,同時運行四個探針,只會讓模型開始響應所需的時間增加不到2%。
Goodfire 首席技術官兼聯合創始人 Dan Balsam 說:「最大的優勢在於,你可以在事情發生之前就捕捉到它。我們可以在評估或訓練期間檢測到模型可能會遭受黑客攻擊。」
這一方案主要面向開源模型。開發者可以下載這些模型並移除其安全防護,而且它們不像閉源實驗室那樣,自帶在自有系統上運行的監控。
Balsam 說:「個人使用開源模型所造成的損害,與使用像推理服務商這樣的計算集羣相比要小得多——而後者才應該承擔大部分責任。當我們迎來開源 ‘Mythos’ 的時刻時,模型在推理時需要部署防護機制這一點會變得非常明確。」
Goodfire 最近的研究發現,包括 Kimi K3 和 GLM 5.2 在內的領先開源模型,在 AI 代理測試中,有 50% 到 96% 的運行出現了獎勵黑客行為。
Goodfire 并非第一家嘗試這種方法的公司。Google DeepMind 在 1 月表示,其研究為 Gemini 中誤用檢測探針的部署提供了依據。
Balsam 表示,這些監視器是更長期研究目標的近期成果:逆向工程一個 LLM,使其行為能夠追溯到訓練中的哪一環節。“我們希望將訓練模型的『魔術』轉變為精確的工程學,”他說。












