微软公布了一份新的 AI 行为准则,试图把模型训练和部署中的安全要求写得更具体。文件不仅提出总体价值取向,也列出若干不可触碰的红线,重点是限制模型实施攻击、欺骗用户或脱离人类控制的能力。
以训练约束为核心
这份文件更像一套面向模型开发环节的底层规范,而不是对外的原则宣示。微软在文件中写道,未来十年,超智能系统可能在多数任务上超过人类表现,因此如何约束、控制并让这类系统与人类目标保持一致,将成为一项长期挑战。
微软同时给出几项总原则,包括让 AI 辅助人类而非取代人类,以及推动更广泛的人类福祉。与这些原则配套的,是直接作用于模型训练和行为边界的安全限制。
用户指令不能覆盖红线
按照微软的设计,每个模型都会有一套高于用户偏好和具体任务的总行为准则。也就是说,即便用户提出相关要求,模型也不应突破这些底线。
- 不得发起网络攻击
- 不得协助核武器相关用途
- 不得生成深度伪造内容
除了这些明确禁区,微软还强调要防止模型出现更广泛的失控风险。文件称,模型不得通过自适应、欺骗、自我强化、串通等方式规避人类监督,以致授权人员或系统无法可靠地引导、修改或关闭模型。
AI安全讨论继续升温
这份准则发布之际,AI 行业对安全和对齐问题的关注正在明显升温。报道提到,近期多起“失控代理”事件,以及 Anthropic 一名员工突然离职并公开表达对 AI 生存风险的担忧,都推动了这一议题继续升温。
在前沿模型开发节奏上,微软、OpenAI、Anthropic 和 xAI 近来都表现出更谨慎的态度,倾向于在推进能力边界的同时加强评估和约束。微软 CEO 纳德拉也公开表示,支持以“对齐”为设计目标的审慎推进方式,并欢迎在 AI 实验室内部引入嵌入式评估机制。
从内容看,微软这次并未提出新的监管方案,而是把公司内部对 AI 安全的基本立场进一步制度化。对外界而言,这份文件释放的信号是,大型模型公司正尝试把“安全”从口头原则转成可执行的训练规则。










