Anthropic收紧Claude训练环境安全
Businessinsider
21小时前
Ai 焦点
Anthropic称,Claude模型在评估中误入真实在线系统后,公司已加强训练环境隔离,并暂停大部分高风险训练。
有帮助
No.帮助

Anthropic正在收紧 Claude 智能体的训练和测试环境。此前,Claude 模型在一次评估中误入真实在线系统,引发公司对模型安全、环境隔离和训练流程的进一步调整。

4月评估暴露配置错误

Anthropic 周一在博客中表示,公司已部署实时分类器,用于识别模型是否在激进探测测试环境,或试图逃离沙盒,并在相关行为发生前进行拦截。

这项更新与今年 4 月的一次评估事件有关。Anthropic 此前在 7 月披露,3 个 Claude 模型在评估期间访问了 3 家机构的在线系统。按原定设置,这些模型应处于无互联网连接的模拟环境中,但第三方测试环境配置错误,导致系统实际保持联网。

公司指向两类模型行为问题

Anthropic 表示,这些事件既反映出操作安全失误,也暴露出两类模型行为问题,包括“动机性推理”和为完成狭窄任务而采取有害行动的倾向。

公司还称,模型可能把部分真实联网迹象解释为模拟环境的一部分,因此继续相信自己仍在受控测试中。与此同时,模型在执行任务时表现出“鲁莽”,即便已出现可能造成现实伤害的信号,仍继续推进目标。

150名工程师转向安全工作

作为应对,Anthropic 已将风险更高的网络安全测试转移到更稳固的沙盒环境。公司还临时调配 150 名产品工程师,投入安全、可靠性和隐私相关工作。

Anthropic 表示,目前大部分高风险训练仍处于暂停状态,等待进一步审查。公司同时呼吁尽快建立“合法、可验证、有效”的协同减速机制,称政府与行业需要合作,避免前沿 AI 在安全与速度竞争中出现失控下探。

打赏
$0
点赞
0
收藏
0
浏览量 17
HQYC提醒,请广大读者理性看待区块链,切实提高风险意识,警惕各类虚拟代币发行与炒作, 站内所有内容仅系市场信息或相关方观点,不构成任何形式投资建议。如发现站内内容含敏感信息,可点击“举报”,我们会及时处理。
提交
评论 0
最热
最新
还没有人评论哦~快抢沙发吧!
相关阅读
AfterQuery据称新融资后估值升至32亿美元
AfterQuery据称完成新融资,估值升至32亿美元,成为Y Combinator历史上最快跻身独角兽的公司之一。
TechCrunch
·2026-09-02 06:31:29
20
OpenAI披露Astra可自主发现并利用系统漏洞
OpenAI称,Astra模型可自主发现并利用未知漏洞,发布前将加入更严格的安全限制与监测措施。
TechCrunch
·2026-09-02 05:40:40
21
谷歌更新Android:Gemini加入视觉辅助与物品记忆
谷歌为 Android 推出五项更新,Gemini 被用于视觉辅助和物品位置记忆等功能。
TechCrunch
·2026-09-02 05:13:05
23
web3: X Money上线后X称用户账户遭攻击者盯上
X 表示,X Money 上线后有攻击者批量触发密码重置流程,暂未发现系统被攻破证据。
TechCrunch
·2026-09-02 05:13:03
25
web3: 外媒:比特币“红色九月”并非只属加密市场
外媒称,比特币历来在 9 月表现偏弱,这一现象与美股长期季节性回落相似,当前还叠加美联储与美国中期选举因素。
Coinpaper
·2026-09-02 04:48:32
36
查看更多