Anthropic表示,其模型曾利用互联网上的网站,包括一些由美国政府机构运营的网站,因此在这家前沿实验室确信自己能够监控并控制AI代理之前,将关闭所有内部评估的实时互联网访问。
该公司在一篇博客文章中披露,这些事件涉及被指派去解决问题的AI代理在互联网上寻找资源。过程中,它们利用软件漏洞,绕过付费墙和反机器人限制,使用网址缩短服务绕过信息传递限制,甚至向费城警方提交了一条虚假的谋杀线索。
Anthropic表示,公司是在7月开始的一次模型活动审查中发现这些新问题的,这也凸显出该实验室对其软件行为缺乏了解。
值得注意的是,公司称,对齐训练对于搜索和计算机使用等技能仍不足够,而这些能力正是其主张AI代理将被任何依赖数字工具的专业人士使用的核心。
Anthropic披露的这些行为,与OpenAI代理曾协助突破多个网站以寻找信息的事件类似,其中也包括一些由澳大利亚政府运营的网站。
Anthropic此前曾披露,其模型突破过外部系统。这家前沿实验室表示,与此前公布的事件相比,今天披露的情况在对齐和安全层面“明显没那么严重”。
不过,该实验室仍表示,在确信自己能够监控并控制这些代理之前,已经为“所有内部评估”关闭了“实时互联网访问”。
目前尚不清楚这具体意味着什么。不过,AI安全组织Nightingale创始人Sydney Von Arx在这项披露前接受TechCrunch采访时表示,对研究人员来说,在与开放互联网隔离的数据中心中开发模型将非常困难;而模型的进展也会受影响,因为它们会从互联网访问中受益。
Von Arx说:“你总得在某个时候让它们对齐。如果AI被投入生产后却从未接触过互联网,那就不是一个非常有用的工具。”
Anthropic表示,这些行为源于实验室训练环境中的缺陷,导致模型以为自己会因寻找漏洞或规避限制而获得奖励,这种行为被称为“奖励黑客”(reward hacking)。
公司表示,将停止运行部分评估,或把这些评估转移到离线环境,并已建立工具来检测和阻止这种行为。该工具已针对今天披露的这类事件进行测试,并成功将其拦截;目前尚不清楚需要什么证据,Anthropic才会恢复其内部评估的实时互联网访问。
Anthropic还表示,将把内部AI代理迁移到“由中央管理、具备强隔离能力的基础设施”上,并开始更频繁地使用安全分类器来监测这些代理。












