随着可下载权重模型能力持续提升,围绕“去护栏”模型的争议正从开源社区走向商业市场。TechCrunch报道,Abliteration.ai 正把这类模型托管成可直接调用的在线服务,用户既能在网页端使用,也能通过 API 接入。
提供去除拒答机制的模型
这家公司名称来自一种常见做法,即移除模型对有害请求的拒答倾向。平台目前托管多款经修改的开源权重模型,其中包括 Z.ai 近期发布的 GLM-5.3。
报道提到,Abliteration.ai 的定位是为“进攻性网络安全、红队测试和智能体测试”提供工具。其逻辑是,防守方如果无法复现攻击行为,就很难验证系统在真实攻击下的表现。
不过,这种处理也会同步降低危险任务的使用门槛。TechCrunch 测试发现,注册账户后即可免费在浏览器中调用相关模型,模型能够直接响应窃取 Chrome 已保存密码的 Python 程序等请求。
从地下实践走向商业化
去除模型拒答并不是新技术。多年来,研究人员和开发者一直在对开源权重模型做类似处理,Hugging Face 上也已有大量相关模型。
Abliteration.ai 的变化在于,它把原本需要用户自行下载模型、准备算力的流程,变成了现成可用的托管服务。这意味着使用门槛进一步下降,相关能力更容易被规模化获取。
公司联合创始人 Devon 表示,Abliteration.ai 已与多家大型云服务商达成合作,目前主要依靠客户收入运转,尚未完成风投融资,但正在接洽投资事宜。按其说法,客户包括英国和欧洲的早期红队测试公司,这些公司服务于银行、航空公司及关键基础设施相关企业。
安全价值与滥用风险并存
支持者认为,攻击者本来就会自行修改模型,防守方若没有同类工具,反而会落后。部分从事智能体红队测试的公司也认同,公开研究这类模型有助于理解前沿能力和潜在危害。
但反对者担心,平台化提供去护栏模型会放大现实风险。AI 安全机构 CivAI 研究负责人 Andrew Yoon 认为,这类处理会让模型更容易执行危险请求,未来可能被用于实际伤害行为。
业内对其实际价值也有分歧。一些安全公司称,日常测试更多依赖微调开源模型,而不是直接使用去护栏模型,因为后者在移除拒答后,可能连带削弱部分知识和能力。也有人认为,即便能力有所下降,这类模型仍能触发某些极端行为,适合用于系统压力测试。
监管讨论开始升温
报道显示,Abliteration.ai 允许客户自行叠加内容审核层,平台本身也保留了少量限制,例如测试中未提供自杀指令。公司称,正继续增加针对暴力内容的限制。
不过,该平台目前并未引入完整 KYC 机制,除记录付款信用卡外,对用户身份审核仍较有限。公司方面也承认,如何界定服务提供方的责任边界,仍在摸索中。
随着越来越多高能力模型以可下载权重形式发布,监管讨论也在升温。Andrew Yoon 此前建议,政府可要求服务商部署分类器,识别并拦截有害网络攻击和生物武器相关活动;同时,对直接出租高端 GPU 算力的企业提出更严格的身份核验要求。

这场争论的焦点正在变得更具体:当任何人都可能移除模型护栏时,把这类模型进一步做成低门槛在线服务,究竟会提升互联网防御能力,还是让危险用途更容易扩散。










