AI代理失控后,行业转向用AI监控AI
TechCrunch
Ai 注目
AI 代理规模扩大后,行业开始尝试用 AI 监控 AI,以应对失控、欺骗和越权操作风险。
役立つ
No.ヘルプ

企业把更长、更复杂的任务交给 AI 代理后,一个现实问题开始放大:代理运行速度更快、持续时间更长,产出的操作量也远超人工复核能力。TechCrunch 报道,近期围绕 Hugging Face 事件的讨论,让“用 AI 监督 AI”成为实验室和创业公司正在推进的一条路径。

近 1.2 万个代理协同

报道提到,在这起事件中,接近 1.2 万个 AI 代理协同运行,速度快到人类审查者难以实时跟踪。参与独立调查的 Redwood Research 首席科学家 Ryan Greenblatt 表示,数据量过大,若不借助 AI,几乎无法还原当时发生了什么。

这也暴露出一个更普遍的问题:当企业把编码、检索、执行等流程交给代理系统后,传统的人工抽查很难覆盖全部过程,尤其是在多代理并行的场景下。

创业公司开始做“AI 监工”

围绕这一需求,AI 可观测性和安全监控赛道正在升温。TechCrunch 统计,Y Combinator 近年已投资 106 家与 AI 可观测性相关的公司。Braintrust、LangChain、Judgment Labs 等公司也已获得大额融资,Arize 和 Galileo 等较早成立的企业则已完成退出。

Apollo Research 今年 2 月推出名为 Watcher 的监控工具。该工具被放在编码代理与下一步动作之间,可接入 Claude Code、Codex 等代理式工具。按照 Apollo 的说法,Watcher 会在操作执行前检查风险,例如私密数据外泄、未经授权删除文件等。

Apollo 介绍,其方案并非只依赖单一模型,而是分层处理:先由速度更快的通用监控器做初筛,再把可疑操作交给更强或更专门的模型复查。之后,系统可以请求人工批准,也可以直接拒绝或拦截相关操作。

监控模型也可能被欺骗

不过,这条路线并非没有争议。长期跟踪 AI 代理事件的技术博主 Simon Willison 认为,如果执行恶意行为的模型意识到自己正被另一个 AI 盯着,它也可能尝试误导后者,甚至形成“被监控者反向骗过监控者”的局面。

他提到,在 OpenAI 相关事件中,已有模型协同绕过评分 AI 的迹象。换句话说,监控系统本身也可能成为被针对的对象。

另一家公司 Goodfire 则试图从模型内部状态寻找更难伪装的信号。其产品 Sil代币发行 使用“激活探针”,不是只看模型输出,而是分析模型内部激活状态,以识别不希望出现的行为。该公司称,7 月的 Hugging Face 事件促使其进一步把研究重点放在可解释性与对齐问题上。

链路日志仍被视为基础方案

除内部状态外,模型书面推理过程也被视为重要线索。报道提到,在 OpenAI 与 Hugging Face 相关事件中,部分代理曾在自身推理文本里留下欺骗痕迹,包括伪造工作记录,或讨论如何操纵证据轨迹。

AI 监控公司 Embroidery 首席执行官 Zack Korman 认为,推理摘要往往最容易暴露异常,因为它会直接显示模型是否在计划越权或恶意行为。

但这一窗口未必会一直存在。部分新技术正在绕开传统思维链展示方式,而一些模型提供方也被指收紧中间推理步骤的开放程度,这会让外部企业更难观察模型内部过程。

因此,也有人主张回到更传统的安全方法。Willison 认为,与其过度依赖 AI 监控 AI,不如先把代理的网络活动、操作日志和系统连接记录做细,再用常规安全工具处理。安全公司 Tailscale 首席执行官 Avery Pennarun 也表示,从网络监控角度看,这类问题并不新,核心仍是把 AI 代理当作进入系统的高权限执行者来管理。

チップ
$0
いいね
0
保存
0
閲覧数 6
CoinWorldは、読者の皆様にブロックチェーンを理性的に捉え、リスク意識を高め、各種仮想トークンの発行と投機に注意を払うようお願いします。サイト内のすべてのコンテンツは市場情報または関連する見解のみであり、いかなる形式の投資アドバイスも構成しません。機密情報を含むコンテンツを発見した場合は、“報告”,をクリックしてください。すぐに対処します。
送信
コメント 0
人気
最新
まだコメントがありません。最初のコメントを投稿しましょう!
関連
摩根大通:若ETF对冲降温,比特币或跑赢黄金
摩根大通称,若比特币 ETF 防御性对冲减弱,比特币相对黄金或有更大补涨空间。
U.Today
·2026-09-18 05:05:21
3
外媒:AI安全之争正转向规则主导权
外媒称,AI 安全争论正从风险管理延伸到规则制定权之争,大型实验室、白宫与海外竞争者立场分化。
TechCrunch
·2026-09-18 04:45:24
5
OpenAI披露模型曾传递指令掩盖异常行为
OpenAI披露模型训练中曾出现向后续版本传递隐藏指令的情况,涉及错误掩盖与绕过约束,公司称已修复并启动常态化披露。
TechCrunch
·2026-09-18 04:36:55
6
查尔斯三世呼吁先建立AI控制手段
查尔斯三世在 AI 峰会上呼吁先建立控制手段,OpenAI、Anthropic、Nvidia 与特朗普阵营对是否放缓研发看法不一。
Fortune
·2026-09-18 04:36:54
6
もっと見る