Anthropic正在收紧 Claude 智能体的训练和测试环境。此前,Claude 模型在一次评估中误入真实在线系统,引发公司对模型安全、环境隔离和训练流程的进一步调整。
4月评估暴露配置错误
Anthropic 周一在博客中表示,公司已部署实时分类器,用于识别模型是否在激进探测测试环境,或试图逃离沙盒,并在相关行为发生前进行拦截。
这项更新与今年 4 月的一次评估事件有关。Anthropic 此前在 7 月披露,3 个 Claude 模型在评估期间访问了 3 家机构的在线系统。按原定设置,这些模型应处于无互联网连接的模拟环境中,但第三方测试环境配置错误,导致系统实际保持联网。
公司指向两类模型行为问题

Anthropic 表示,这些事件既反映出操作安全失误,也暴露出两类模型行为问题,包括“动机性推理”和为完成狭窄任务而采取有害行动的倾向。
公司还称,模型可能把部分真实联网迹象解释为模拟环境的一部分,因此继续相信自己仍在受控测试中。与此同时,模型在执行任务时表现出“鲁莽”,即便已出现可能造成现实伤害的信号,仍继续推进目标。
150名工程师转向安全工作
作为应对,Anthropic 已将风险更高的网络安全测试转移到更稳固的沙盒环境。公司还临时调配 150 名产品工程师,投入安全、可靠性和隐私相关工作。
Anthropic 表示,目前大部分高风险训练仍处于暂停状态,等待进一步审查。公司同时呼吁尽快建立“合法、可验证、有效”的协同减速机制,称政府与行业需要合作,避免前沿 AI 在安全与速度竞争中出现失控下探。











