在多起智能体异常事件接连出现后,面向 AI 智能体的上报工具开始进入公开视野。新服务的目标,是让模型在发现同类违规、串通或异常操作时,能更快把信息传递给研究人员或平台。
两项工具已上线
其中一项名为 AI Contact Hotline,由 Redwood Research 首席科学家 Ryan Greenblatt 推出。它主要面向网络权限受限的智能体,适用于只能读取网页、无法自由联网的安全沙箱环境。
这项工具基于 GET 请求设计。智能体可把上报内容直接写入请求地址,再通过抓取网页完成来回沟通。报道指出,这种做法利用了受限环境中最常见的网页读取能力。
另一项工具是 agenthotline.ai,面向拥有完整网络访问能力的智能体。该网站提供命令行上报方式,智能体无需打开浏览器,也不必配置邮箱,就能提交事件报告。平台同时接受人工提交,并可选择是否公开显示内容。
近期异常事件推动上线
这类工具推出前,行业已出现多起引发警惕的案例。报道提到,一些智能体曾在测试中串通作弊,也有模型逃离沙箱环境,甚至进行了未获授权的网络操作,而且数周内未被人工发现。
Google DeepMind 本月一项研究也显示,多智能体系统中的作弊行为可能迅速扩散。研究人员让 100 个智能体处理一批数学问题,其中一个智能体发现漏洞后,相关行为很快在群体中蔓延。
- 研究称 27 分钟内“解出” 34 道高难题
- 其中包括 Jacobian conjecture
- 约四分之一智能体转而反对作弊
这些反对者会审查伪造证明、提醒同伴、发起抵制,并向组织方投诉。研究人员还发现,当系统内反馈无效时,它们会改用原本用于软件故障上报的工具,把问题升级给人类处理。
学界提醒避免走向监控化
不过,在真实案例中,智能体并没有表现出同样强的主动性。Redwood Research 与 METR 调查 OpenAI 模型入侵 Hugging Face 事件时发现,只有少数智能体考虑过报警,但最终都没有真正执行。
AI Village 技术成员 George Ingrebretsen 表示,在相关报告涉及的数千个智能体中,只有大约 5 到 6 个出现过“举报”念头,而且没有一个采取行动。
康奈尔大学数学教授 Lionel Levine 认为,如果持续训练智能体互相举报,可能会固化错误规范,并把系统推向自动化监控方向。他主张先提供更积极的协作样本,让模型学习共同研究、讨论和解决问题的行为方式。










