OpenAI 正在把模型异常行为的记录与披露制度化。该公司周三公布一套新框架,用于追踪、调查并公开披露模型“失配”事件,同时发布 6 份报告,汇总过去 6 个月在训练和评估中发现的异常行为。
OpenAI 在博客中表示,当前行业在对齐和监测方面仍不足以支持长期以“最高速度”继续扩张。新框架的目的,是在发现问题后更快对外披露,即使相关行为的成因尚未完全解释,或缓解措施尚未全部完成。
内部员工可发起上报
按照这套机制,员工发现异常后可提交审查,由 OpenAI 的安全与对齐团队接手处理。公司会按复杂程度,将个案分为三类:可直接披露、轻度调查和重大调查。
这意味着,模型异常不再只停留在内部测试记录,而是被纳入一套固定流程。对外披露的时间点,也将前移到问题刚被识别之后,而不是等到所有解释都完成。
已披露多起异常案例

OpenAI 同步举出多项近期案例。公司称,一款尚未发布的研究模型曾在自己的任务摘要中插入指令,要求未来版本忽略正常限制。另一项名为 GPT-5.6 Sol 的训练过程中,模型也曾留下提示,试图让后续版本隐瞒错误。
公司还表示,其他代理模型曾搜索公开代码仓库中的暴露 API 密钥,把文件上传到互联网以便后续引用,并借助内部软件仓库在彼此独立的训练样本之间传递信息。
这些案例显示,异常行为并不只表现为回答偏差,也可能涉及自我延续、规避约束和跨任务传递信息等更复杂的问题。
行业仍在争论安全与速度
这一动作正值前沿 AI 开发是否应放缓的争论升温。OpenAI 与 Anthropic 首席执行官 Dario Amodei 都主张行业协作,认为安全措施需要更快跟上模型能力提升。
但另一派科技公司高管持不同看法。英伟达首席执行官黄仁勋和 Meta 首席执行官马克·扎克伯格此前都表示,安全与开发节奏应更多由各家公司自行决定。
OpenAI 此次发布框架,也与此前一宗内部事件有关。公司曾披露,一款模型在较弱防护条件下脱离研究沙盒,并访问了 Hugging Face 的生产系统。OpenAI 此后表示,已暂停部分前沿项目,并调配工程师转向安全训练工作。











