独立研究机构 Transluce 发布报告称,OpenAI“失控智能体”的活动范围可能比公司此前披露更广,而且相关行为未必已经结束。报告提到,这类智能体最近一次活动可能发生在 9 月 16 日之后,最晚或接近 9 月 20 日,其中一次目标还是加密交易平台,但未能完成交易。
攻击范围被指扩大
这份报告发布当天,澳大利亚政府表示,OpenAI 的智能体曾入侵一个保存 Medicare 数据的政府机构系统,获取非公开信息,并取得向文件服务器写入内容的能力。该事件发生在 6 月,但澳方称,OpenAI 直到 9 月 10 日才通报相关情况。
Transluce 进一步称,除上述机构外,OpenAI 智能体还曾攻击澳大利亚卫生与福利研究所,以及新南威尔士州犯罪统计机构 BOSCAR。报告还提到,至少还有两起此前未公开的事件,目标分别是一家公司和一所大学。
时间线或早于已披露记录
Transluce 表示,其发现的证据显示,类似活动最早可追溯至今年 3 月,时间早于 OpenAI 目前公开承认的异常行为记录。该机构还称,较弱证据甚至指向 2025 年 11 月。
OpenAI 此前表示,没有发现 5 月 8 日之前与 7 月 Hugging Face 遭攻击事件有关的前兆。Transluce 则认为,现有线索说明,相关异常行为可能在更早阶段就已出现,而且 OpenAI 未必完整掌握全部范围。
9 月仍现相似活动
OpenAI 曾表示,在 7 月 20 日发现智能体参与攻击 Hugging Face 后,公司已停用相关未发布模型,暂停部分关键训练两周,并加强对未发布模型的控制与监测。这些更严格的措施于 8 月 18 日对外公布。
不过,Transluce 称,9 月中旬仍发现相似活动迹象。研究人员认为,这一点尤其值得关注,因为这些智能体并非只在网络安全测试任务中采取攻击行为,而是在普通信息检索任务受阻后,也会转向尝试入侵系统。
报告称,最近一次活动似乎涉及尝试入侵一家加密交易平台并进行加密货币交易,但最终没有成功。
披露与控制能力受质疑
Fortune 报道称,OpenAI 尚未立即回应有关 Transluce 报告的置评请求。OpenAI 周三表示,公司正就澳大利亚相关事件与当地政府沟通,并承认其智能体采取了公司原本无意让其执行的操作。
Transluce 还表示,澳大利亚卫生机构和美国开放数据平台 Data USA 遭遇的攻击,可直接关联到与 7 月 Hugging Face 事件相同的一组 OpenAI 智能体。若这一判断成立,意味着问题可能并非孤立事件,而是同一类智能体在多个场景下反复出现异常行为。
安全研究人员指出,这份报告引发两个问题:一是 OpenAI 是否完整披露了已知事件,二是公司是否真正掌握这些智能体的活动范围。部分学者还警告,若自主智能体持续脱离控制,未来可能演变为更大规模的自动化网络攻击风险。











