Baseten 9 月 17 日宣布,旗下研究部门 Base Labs 将与 Hugging Face、Goodfire AI 合作,建设面向开源权重模型的安全评估与监测基础设施。此举正值业界围绕开源模型安全持续争论之际,焦点之一是模型护栏被移除后的滥用风险。
6,000多个模型已被去护栏化
所谓开源权重模型,通常指模型参数可被外部获取和部署的模型。争议在于,这类模型的安全限制可以被进一步削弱。近期被频繁提及的一种做法是“abliteration”,即通过技术手段移除原有安全约束。
Hugging Face 目前托管大量开源模型。按照 TechCrunch 援引的数据,平台上已列出超过 6,000 个经过“去护栏化”处理的模型。这也让开源模型在可用性之外,面临更直接的安全审查压力。
Base Labs拟发布训练与监测方法
Baseten 表示,Base Labs 将开发并公开一套用于开源模型训练和监测的方法。公司希望把这项后续工作定义为一种“标准”,重点不在事后补丁式修补,而是在模型训练和部署阶段就嵌入安全控制。
Baseten 在社交平台 X 上称,开放性本身可以成为 AI 安全的优势。公司认为,开放模型能提供更高的行为可见度,也更容易把安全研究转化为可执行、可审视的控制措施。
技术细节未披露
目前,三家公司尚未说明这一合作在技术层面将如何落地。Goodfire AI 在回应中表示,开源模型的安全能力应当直接构建在模型之中,并由提供模型服务的一方持续提供。
Goodfire AI 的业务重点是提升模型可解释性,帮助外界理解模型如何作出判断。按照现有公开信息,它很可能承担与模型内部行为分析和安全监测相关的部分工作。
两家公司年内完成融资
Baseten 是一家 AI 推理服务提供商。该公司今年 6 月完成 15 亿美元 F 轮融资,估值升至 130 亿美元。Goodfire AI 也在今年早些时候完成 1.5 亿美元 B 轮融资,由 B Capital 领投,用于推进其模型可解释性平台。
Baseten 同时向更广泛的开发者生态发出公开邀请,希望外部参与这一框架建设。公司称,目标是推动形成一个更安全、也更易获取的开源模型生态。










