隨著可下載權重模型能力的持續提升,圍繞「去護欄」模型的爭議正從開源社區走向商業市場。TechCrunch 報導,Abliteration.ai 正在將這類模型托管成可直接調用的在線服務,用戶既能在網頁端使用,也能通過 API 進行接入。
提供去除拒答機制的模型
這家公司的名字來自一種常見的做法,即去除模型對有害請求的拒答傾向。該平台目前托管多款經修改的開源權重模型,其中包括 Z.ai 最近發布的 GLM-5.3。
報導提到,Abliteration.ai的定位是為「攻擊性網絡安全、紅隊測試和智能體測試」提供工具。其邏輯是,如果防禦方無法重現攻擊行為,就很難驗證系統在真實攻擊下的表現。
不過,這種處理方式也會同步降低危險任務的使用門檻。TechCrunch 的測試發現,註冊賬戶後即可在瀏覽器中免費調用相關模型,該模型能夠直接響應竊取 Chrome 已保存密碼的 Python 程序等請求。
從地下實踐走向商業化
去除模型拒答並非新技術。多年來,研究人員和開發者一直對開源權重模型進行類似處理,Hugging Face 上也已存在大量相關模型。
Abliteration.ai 的變化在於,它將原本需要用戶自行下載模型、準備算力的流程,變成了現成可用的托管服務。這意味著使用門檻進一步降低,相關能力更容易被規模化獲取。
公司聯合創始人 Devon 表示,Abliteration.ai 已與多家大型雲服務供應商達成合作,目前主要依靠客戶收入運營,尚未完成風投融資,但正在接洽投資事宜。據其說法,客戶包括英國和歐洲的早期紅隊測試公司,這些公司為銀行、航空公司及關鍵基礎設施相關企業提供服務。
安全價值與濫用風險並存
支持者認為,攻擊者本來就會自行修改模型,如果防禦方沒有類似的工具,反而會落後。部分從事智能體紅隊測試的公司也認同,公開研究這類模型有助於理解前沿能力及潛在危害。
但反對者擔心,平台化提供去柵欄模型會放大現實風險。AI 安全機構 CivAI 研究負責人 Andrew Yoon 認為,這類處理會讓模型更容易執行危險請求,未來可能被用於實際傷害行為。
業內對其實際價值也存在分歧。一些安全公司表示,日常測試更多依賴於微調開源模型,而非直接使用「去柵欄」模型,因為後者在移除拒答機制後,可能會連帶削弱部分知識和能力。也有人認為,即便能力有所下降,這類模型仍能觸發某些極端行為,適合用於系統壓力測試。
監管討論開始升溫
報導顯示,Abliteration.ai允許客戶自行加載內容審查層,平臺本身也保留了少量限制,例如在測試中未提供自殺指令。公司稱,正繼續增加針對暴力內容的限制。
不過,該平台目前尚未引入完整的 KYC 機制,除了記錄付款信用卡信息外,對用戶身份審核仍較有限。公司方面也承認,如何界定服務提供方的責任邊界,仍在摸索中。
隨著越來越多高能力模型以可下載權重形式發布,監管討論也在升溫。此前建議,政府可要求服務商部署分類器,識別並攔截有害網絡攻擊和生物武器相關活動;同時,對直接出租高端計算力の企業提出更嚴格的身份核驗要求。

這場爭論的焦點正變得越來越具體:當任何人都有可能移除模型的保護裝置時,將這類模型進一步發展為低門檻的線上服務,究竟會提升互聯網的防禦能力,還是讓危險用途更容易擴散?










