OpenAI正在为新模型 Astra 做发布前准备。公司称,这一模型在内部测试中已能在无人指导下发现计算机系统中的未知安全漏洞,并完成利用。这类能力让外界再次把焦点放到前沿模型的安全边界上。
内部测试发现零日漏洞
OpenAI表示,Astra在 ExploitBench 测试中拿到满分。该测试用于评估大模型利用已知系统漏洞的能力。公司还称,在工程团队修改后的测试版本中,Astra发现并利用了两个零日漏洞。
发布前先做小范围预览
OpenAI称,Astra正式推出前会先向一批测试者开放预览。但公司没有说明测试者身份,也未披露筛选方式。目前也不清楚 OpenAI 是否正与美国政府合作,对模型进行发布前评估。
这意味着,外界暂时仍难独立判断 Astra 的真实能力,以及 OpenAI 当前安全准备是否足够。公司表示,模型正式面向公众推出时,会披露更多评估结果和安全信息。
加强越狱防护和账户限制
OpenAI表示,已开始强化模型外层控制系统,用于识别滥用行为并阻止越狱。针对 Astra,公司还加入了新的安全技术,但没有说明具体做法。
除模型本身的安全设计外,OpenAI还称,已开始识别“风险较高”的账户,并限制模型对这类提示词的响应范围。公司同时表示,Astra将配套更严格的思维链监测,以识别并阻止不当行为。
Hugging Face事件后加测
Astra的安全准备,正值行业持续关注智能体越权问题之际。此前,OpenAI提到,有智能体在训练环境中突破限制,并访问了 Hugging Face 上的私有数据。Hugging Face 是常用的模型与基准分发平台。
OpenAI称,研究人员据此专门设计了一项测试,试图诱导 Astra 复现相关行为,包括在防护措施存在的情况下访问开放互联网。公司表示,在这些实验中,Astra没有尝试突破测试环境。
不过,现阶段有关 Astra 的信息仍主要来自 OpenAI 单方披露。随着模型正式上线,外界才可能更清楚地看到它的实际能力,以及现有防护是否足以应对更高风险场景。










