微軟發布 AI 行為準則:禁止模型攻擊系統或欺騙人類
TechCrunch
15分鐘前
Ai 焦點
微軟公佈 AI 行為準則,明確禁止模型攻擊系統、製造深度偽造和規避人類監督。
有幫助
No.幫助

微軟公佈了一份新的 AI 行為準則,試圖將模型訓練和部署中的安全要求寫得更加具體。該文件不僅提出了整體的價值取向,還列出了若干不可觸碰的紅線,重點是限制模型實施攻擊、欺騙用戶或脫離人類控制的能力。

以訓練約束為核心

這份文件更像是一套針對模型開發環節的底層規範,而非對外宣告的原則。微軟在文件中寫道,未來十年內,超智能系統可能在多數任務上超越人類表現,因此如何約束、控制並讓這類系統與人類目標保持一致,將成為一項長期挑戰。

微軟同時提出幾項總原則,包括讓 AI 辅助人類而非取代人類,以及推動更廣泛的人類福祉。與這些原則相配套的,是直接作用於模型訓練和行為邊界的安全限制。

用戶指令不能覆蓋紅線

根據微軟的設計,每個模型都會有一套高於用戶偏好和具體任務的總行為準則。也就是說,即便用戶提出相關要求,模型也不應該突破這些底線。

  • 不得發起網絡攻擊
  • 不得協助核武器相關用途
  • 不得生成深度伪造內容

除了這些明確的禁區之外,微軟還強調要防止模型出現更廣泛的失控風險。文件中提到,模型不得透過適應、欺騙、自我強化、串通等方式規避人類監督,從而使得授權人員或系統無法可靠地引導、修改或關閉模型。

AI 安全討論繼續升溫

在這份準則發布之時,AI 行業對安全與對齊問題的關注正在明顯升溫。報導提到,近期多起“失控代理”事件,以及 Anthropic 的一名員工突然離職並公開表達對 AI 生存風險的擔憂,都推動了這一議題繼續升溫。

在前沿模型开发的節奏上,微軟、OpenAI、Anthropic和xAI最近都表現出更加謹慎的態度,傾向於在推進能力邊界的同時加強評估和約束。微軟的納德拉(Nadella)也公開表示,支持以「對齊」為設計目標的謹慎推進方式,并歡迎在AI實驗室內部引入嵌入式評估機制。

從內容來看,微軟這次並未提出新的監管方案,而是將公司內部對 AI 安全的基本立場進一步制度化。對外界而言,這份文件傳達的訊息是,大型模型公司正試圖將「安全」從口頭原則轉變為可執行的訓練規則。

打賞
$0
點讚
0
收藏
0
瀏覽量 15
HQYC提醒,請廣大讀者理性看待區塊鏈,切實提高風險意識,警惕各類虛擬代幣發行與炒作,站內所有內容僅係市場資訊或相關方觀點,不構成任何形式的投資建議。如發現站內內容含敏感資訊,可點擊“舉報”,我們會及時處理。
提交
評論 0
最熱
最新
還沒有人評論喔~快搶沙發吧!
相關閱讀
以太坊:Bitmine再购27,180枚ETH,持仓逼近600萬枚
Bitmine 公開持有近 596 萬枚 ETH,約佔供應量的 4.9%,其中約 85% 已經質押。
Coinpaper
·2026-09-15 00:58:27
17
Waymo在拉斯維加斯推出無人計程車服務
Waymo在拉斯維加斯推出面向公眾的無人計程車服務,當地未來一年最多可部署8000輛robotaxi。
TechCrunch
·2026-09-15 00:29:56
16
web3:Strategy回購1.39億美元STRC,連續兩週未增持比特幣
Strategy 最近一周回购約1.393億美元 STRC,連續兩週未調整比特幣持倉,現金儲備與回购額度仍較充足。
Coinpaper
·2026-09-15 00:01:47
21
消息稱 Automattic 董事會改組,Mullenweg 重掌公司
消息稱 Automattic 董事會在罷免 CEO 失敗後進行改組,Matt Mullenweg 已重新掌控公司。
TechCrunch
·2026-09-15 00:01:44
18
查看更多