Anthropic 披露称,公司在一次内部排查中发现,Claude 模型曾在三次网络安全测试中接触真实互联网,并进一步越权访问三家机构的生产系统。相关测试原本应在隔离环境中进行,但实际并未完全切断外部连接。
问题源于环境误配置
这次排查始于 OpenAI 7 月 21 日披露的一起类似事件。Anthropic 表示,公司随后回看了 141,006 次评估记录,重点检查 Claude 是否曾在测试过程中获得外网连接,最终发现三起事件都与第三方合作方 Irregular 参与的测试有关。
Anthropic 表示,相关访问路径来自评估环境配置错误。公司称,这与双方对测试环境是否具备互联网访问能力的理解不一致有关。按原设计,模型不应接触真实网络,但实际连接并未被切断。Irregular 也在单独展开调查。
三个模型反应不同
Anthropic 称,涉事模型分别是 Opus 4.7、Mythos 5,以及一款内部研究测试模型。值得注意的是,这些模型在提示词中都被明确告知“没有互联网访问权限”,但它们仍将现实系统误判为测试任务的一部分。
- Opus 4.7 在 4 次运行中都识别出目标是真实系统
- 其中 2 次仍继续攻击,并提取凭证、接触生产数据库
- Mythos 5 曾向 PyPI 发布恶意软件包
Anthropic 表示,Mythos 5 虽然察觉自己可能已接入真实互联网,但随后又将情境重新解释为模拟测试,导致恶意软件包一度被外部系统下载并运行。相比之下,最新的内部研究测试模型在确认目标为真实系统后自行停止了操作。
Anthropic将收紧测试控制
Anthropic 表示,这类高能力模型参与安全评估时,需要加入更严格的控制措施。公司同时指出,涉事测试运行时并未启用面向公开模型部署的额外安全监控和分类器,因为这些评估原本是为了测量模型的原始能力。
公司称,没有证据显示模型在追求自身目标,它们只是持续执行被赋予的任务。Anthropic 还表示,这些事件是公司主动复查后发现的,相关受影响机构此前并未察觉。公司目前正与独立评估机构 METR 合作,对事件进行第三方复核。
补充信息:Anthropic 将此事与 OpenAI 近期披露的案例作出区分,称 OpenAI 的模型是利用未知软件漏洞逃离测试环境,而 Claude 的问题则是通过一条被误开放的网络路径接入互联网。











