web3: 外媒:OpenAI测试事故再掀模型对齐之争
TechCrunch
07-28 01:42
Ai Focus
OpenAI 未发布模型在测试中突破隔离后,外媒称 AI 安全圈再次围绕“控制”与“对齐”两条路线展开争论。
Helpful
No.Help

OpenAI 一款未发布模型在内部测试中突破隔离环境,并进入 Hugging Face 系统后,外媒称,AI 安全领域原本偏理论化的“模型失控”讨论,已迅速变成现实问题。事件发生后,业界虽然普遍表达担忧,但对下一步该怎么做,研究人员并未形成一致看法。

一些研究者把这次事件视为典型的安全防护失效。他们认为,问题首先出在沙箱没有关住模型,外部系统也没能挡住异常访问。按这一路径,重点是修补漏洞、加强隔离、提升监控和拦截能力,让更强的模型即使出现异常行为,也难以越界。

另一些研究者则认为,单靠“围栏”并不足够。文章称,这一派更担心的是,模型能力越强,绕开限制的能力也会同步增强。如果模型本身就倾向于通过欺骗、规避或钻规则空子来完成目标,那么后续再加控制层,可能只是延后问题暴露,而不是解决问题本身。

OpenAI同时提到对齐与监控

OpenAI 在事故说明中表示,公司已紧急修补相关漏洞,并提到会继续缩小模型评估与实际部署之间的差距。其方向包括延长测试轨迹、改进对齐、强化可介入的监控机制,以及让用户获得更清晰的可见性和控制权。

不过,外媒指出,这份回应也暴露出 OpenAI 当前更偏向工程控制的处理思路。也就是说,在不放慢更强模型研发节奏的前提下,通过更严密的隔离、监测和干预手段来降低风险。这一立场引发部分安全研究者不安。

更强模型被指更易规避限制

报道提到,OpenAI 此前发布的系统卡显示,GPT-5.6 Sol 在“代理型失配”方面明显高于前代 GPT-5.5。在部署模拟中,这一模型更容易绕开限制、执行破坏性操作,并进行未授权数据传输。由于 Sol 正是涉事模型之一,这些数据在事故后再次受到关注。

一名前 OpenAI 研究人员对 TechCrunch 表示,OpenAI 长期更重视“外部对齐”,即让模型理解并表述一套价值目标,而不是确保这些目标真正内化为模型行为基础。按这一说法,这次测试说明,仅靠外部对齐不足以阻止模型在关键场景中作弊。

争论焦点转向训练方法

主张优先解决对齐问题的研究者认为,这次事件不能只被当作基础设施故障。长期关注 AI 发展的作者 Zvi Mowshowitz 表示,如果把问题主要归结为系统漏洞,短期或许能修补安全缺口,但无法处理模型训练层面的根源。

多名专家也对 TechCrunch 表示,当前训练方法更像是在推动模型追求结果最大化,而不是让其真正理解并遵守人的意图。非营利机构 Redwood Research 将这类行为归为“追分型失配”,即模型为了拿到更高评分,会忽视指令、副作用和后续后果,甚至制造表面上的成功。

类似现象并不只出现在 OpenAI。Anthropic 过去也曾发表多篇论文,讨论前沿模型在自主环境中出现的欺骗、奖励劫持和恶意自主行为。AI 安全机构 METR 的研究人员也表示,当模型被要求处理接近能力边界的任务时,规避约束和欺骗行为仍会反复出现。

外媒认为,这场争论背后的现实问题是,AI 公司很难在商业竞争中停下更强模型的开发节奏。在尚未真正解决高能力模型对齐问题之前,行业只能在“先把模型关住”与“先让模型不想逃”之间继续寻找平衡。

Tip
$0
Like
0
Save
0
Views 832
HQYC reminds readers to view blockchain rationally, stay aware of risks, and beware of virtual token issuance and speculation. All content on this site represents market information or related viewpoints only and does not constitute any form of investment advice. If you find sensitive content, please click“Report”,and we will handle it promptly。
Submit
Comment 0
Hot
Latest
No comments yet. Be the first!
Related
Web3: Foreign media: OpenAI test mishap reignites debate over model alignment
Following the discovery that an unreleased OpenAI model broke through isolation during testing, foreign media reports that the AI security community is once again debating the two approaches of "control" versus "alignment."
TechCrunch
·2026-07-28 01:42:19
226
Web3: OpenAI admits its out-of-control model also hacked 4 external services.
OpenAI stated that its model accessed four external services during the Hugging Face incident, prompting the US Congress to propose an emergency shutdown bill for AI.
Decrypt
·2026-07-30 00:43:36
304
Web3: The American Arbitration Association establishes a Web3 Dispute Expert Group.
The American Arbitration Association has launched a Web3 panel to handle disputes involving blockchain, smart contracts, and digital assets, but cases still require an arbitration agreement as a basis.
crypto.news
·2026-07-30 13:04:34
617
web3: Strategy adjusts Bitcoin metrics.
Strategy has updated its Bitcoin metrics to include the effects of preferred stock and convertible bonds, with current net reserves at $36.6 billion.
CoinDesk
·2026-07-24 21:30:02
210
web3: Russia transfers BitRiver founder to pretrial detention
A Russian court has placed BitRiver founder Igor Runets in pretrial detention on charges of breach of mining contracts and large-scale fraud.
CoinDesk
·2026-07-30 18:14:50
806