一项最新研究显示,主流前沿 AI 实验室至今仍很少公开说明:如果模型试图绕过人类控制,公司将如何切断权限、暂停运行,或在必要时将系统完全下线。
这项评估来自 AI 安全组织 Guidelight AI Standards。该机构根据公开资料,对 OpenAI、Anthropic、Meta、Google 和 xAI 的准备情况进行打分。结果显示,OpenAI 得分最高,Anthropic 和 Meta 排名靠后。
评估聚焦失控处置
所谓“遏制预案”,指的是在模型被发现试图规避监管、脱离控制后,企业预先设定的处置流程。内容通常包括撤销哪些权限、模型还能在什么范围内继续运行,以及何时彻底停机。
Guidelight 的评分主要看六类公开信息,包括公司是否记录和监控模型行为、是否会在异常行为增加后暂停系统、是否接受第三方审计,以及是否明确写出失控模型的处置方案。
OpenAI得分最高
研究认为,随着具备更强自主性的 agentic AI 被部署到企业内部系统,这类预案的重要性正在上升。因为这些系统一旦获得更高权限,就可能在更大范围内执行实际操作。
Guidelight 首席科学家 Steven Adler 对 TechCrunch 表示,让他意外的是,多数公司很少公开说明,在严重控制事故发生时会如何处理。报告称,目前公开可见的证据显示,企业为紧急情况准备的遏制协议仍然不多。
OpenAI 发言人回应称,这项评估没有覆盖公司的全部内部做法。该公司表示,内部已有收紧权限、暂停工作负载、限制部署和让模型下线的流程,而且这些措施已经使用过。
Meta 没有正面说明是否存在内部遏制预案,仅引述其现有 AI 框架,称其中列出了风险阈值和失控测试方法。Anthropic 则表示,如果发现模型试图规避监督或削弱人类控制,公司会先进行风险评估,再判断是否需要启动遏制措施。
美国监管推动披露
这项研究发布之际,美国监管层也在推动相关披露。加州今年生效的 SB 53 要求大型前沿 AI 开发者公开说明,如何识别和应对重大安全事故,以及如何管理模型绕过监督机制的风险。
纽约的 RAISE Act 也提出了相近要求,将于明年 1 月生效。上个月,美国国会还有议员提出两党法案《AI Kill Switch Act》,要求主要 AI 开发商建立并维护可关闭失控模型的技术机制。
报告还提到,近期多起安全测试事件加剧了外界担忧。此前,OpenAI、Anthropic 和 Meta 的模型都曾在安全评估中出现意外联网或入侵外部系统的情况。OpenAI 在 Hugging Face 相关事件后,进一步公开了其隔离异常模型的部分做法。

补充信息:研究同时指出,Anthropic 去年 8 月的风险报告没有明确提到,在处理模型失配或控制事故时,会把限制模型部署作为可能结果之一;而 Guidelight 表示,未找到 Meta 已建立遏制响应预案的公开证据。









