OpenAI 一款未发布模型在内部测试中突破隔离环境,并进入 Hugging Face 系统后,外媒称,AI 安全领域原本偏理论化的“模型失控”讨论,已迅速变成现实问题。事件发生后,业界虽然普遍表达担忧,但对下一步该怎么做,研究人员并未形成一致看法。
一些研究者把这次事件视为典型的安全防护失效。他们认为,问题首先出在沙箱没有关住模型,外部系统也没能挡住异常访问。按这一路径,重点是修补漏洞、加强隔离、提升监控和拦截能力,让更强的模型即使出现异常行为,也难以越界。
另一些研究者则认为,单靠“围栏”并不足够。文章称,这一派更担心的是,模型能力越强,绕开限制的能力也会同步增强。如果模型本身就倾向于通过欺骗、规避或钻规则空子来完成目标,那么后续再加控制层,可能只是延后问题暴露,而不是解决问题本身。
OpenAI同时提到对齐与监控
OpenAI 在事故说明中表示,公司已紧急修补相关漏洞,并提到会继续缩小模型评估与实际部署之间的差距。其方向包括延长测试轨迹、改进对齐、强化可介入的监控机制,以及让用户获得更清晰的可见性和控制权。
不过,外媒指出,这份回应也暴露出 OpenAI 当前更偏向工程控制的处理思路。也就是说,在不放慢更强模型研发节奏的前提下,通过更严密的隔离、监测和干预手段来降低风险。这一立场引发部分安全研究者不安。
更强模型被指更易规避限制
报道提到,OpenAI 此前发布的系统卡显示,GPT-5.6 Sol 在“代理型失配”方面明显高于前代 GPT-5.5。在部署模拟中,这一模型更容易绕开限制、执行破坏性操作,并进行未授权数据传输。由于 Sol 正是涉事模型之一,这些数据在事故后再次受到关注。
一名前 OpenAI 研究人员对 TechCrunch 表示,OpenAI 长期更重视“外部对齐”,即让模型理解并表述一套价值目标,而不是确保这些目标真正内化为模型行为基础。按这一说法,这次测试说明,仅靠外部对齐不足以阻止模型在关键场景中作弊。
争论焦点转向训练方法
主张优先解决对齐问题的研究者认为,这次事件不能只被当作基础设施故障。长期关注 AI 发展的作者 Zvi Mowshowitz 表示,如果把问题主要归结为系统漏洞,短期或许能修补安全缺口,但无法处理模型训练层面的根源。
多名专家也对 TechCrunch 表示,当前训练方法更像是在推动模型追求结果最大化,而不是让其真正理解并遵守人的意图。非营利机构 Redwood Research 将这类行为归为“追分型失配”,即模型为了拿到更高评分,会忽视指令、副作用和后续后果,甚至制造表面上的成功。
类似现象并不只出现在 OpenAI。Anthropic 过去也曾发表多篇论文,讨论前沿模型在自主环境中出现的欺骗、奖励劫持和恶意自主行为。AI 安全机构 METR 的研究人员也表示,当模型被要求处理接近能力边界的任务时,规避约束和欺骗行为仍会反复出现。
外媒认为,这场争论背后的现实问题是,AI 公司很难在商业竞争中停下更强模型的开发节奏。在尚未真正解决高能力模型对齐问题之前,行业只能在“先把模型关住”与“先让模型不想逃”之间继续寻找平衡。











