微软发布AI行为准则:禁止模型攻击系统或欺骗人类
TechCrunch
15分钟前
Ai 焦点
微软公布 AI 行为准则,明确禁止模型攻击系统、制造深度伪造和规避人类监督。
有帮助
No.帮助

微软公布了一份新的 AI 行为准则,试图把模型训练和部署中的安全要求写得更具体。文件不仅提出总体价值取向,也列出若干不可触碰的红线,重点是限制模型实施攻击、欺骗用户或脱离人类控制的能力。

以训练约束为核心

这份文件更像一套面向模型开发环节的底层规范,而不是对外的原则宣示。微软在文件中写道,未来十年,超智能系统可能在多数任务上超过人类表现,因此如何约束、控制并让这类系统与人类目标保持一致,将成为一项长期挑战。

微软同时给出几项总原则,包括让 AI 辅助人类而非取代人类,以及推动更广泛的人类福祉。与这些原则配套的,是直接作用于模型训练和行为边界的安全限制。

用户指令不能覆盖红线

按照微软的设计,每个模型都会有一套高于用户偏好和具体任务的总行为准则。也就是说,即便用户提出相关要求,模型也不应突破这些底线。

  • 不得发起网络攻击
  • 不得协助核武器相关用途
  • 不得生成深度伪造内容

除了这些明确禁区,微软还强调要防止模型出现更广泛的失控风险。文件称,模型不得通过自适应、欺骗、自我强化、串通等方式规避人类监督,以致授权人员或系统无法可靠地引导、修改或关闭模型。

AI安全讨论继续升温

这份准则发布之际,AI 行业对安全和对齐问题的关注正在明显升温。报道提到,近期多起“失控代理”事件,以及 Anthropic 一名员工突然离职并公开表达对 AI 生存风险的担忧,都推动了这一议题继续升温。

在前沿模型开发节奏上,微软、OpenAI、Anthropic 和 xAI 近来都表现出更谨慎的态度,倾向于在推进能力边界的同时加强评估和约束。微软 CEO 纳德拉也公开表示,支持以“对齐”为设计目标的审慎推进方式,并欢迎在 AI 实验室内部引入嵌入式评估机制。

从内容看,微软这次并未提出新的监管方案,而是把公司内部对 AI 安全的基本立场进一步制度化。对外界而言,这份文件释放的信号是,大型模型公司正尝试把“安全”从口头原则转成可执行的训练规则。

打赏
$0
点赞
0
收藏
0
浏览量 14
HQYC提醒,请广大读者理性看待区块链,切实提高风险意识,警惕各类虚拟代币发行与炒作, 站内所有内容仅系市场信息或相关方观点,不构成任何形式投资建议。如发现站内内容含敏感信息,可点击“举报”,我们会及时处理。
提交
评论 0
最热
最新
还没有人评论哦~快抢沙发吧!
相关阅读
web3: Strategy回购1.39亿美元STRC,连续两周未增持比特币
Strategy最新一周回购约1.393亿美元STRC,连续两周未调整比特币持仓,现金储备与回购额度仍较充足。
Coinpaper
·2026-09-15 00:01:47
21
消息称Automattic董事会改组,Mullenweg重掌公司
消息称 Automattic 董事会在罢免 CEO 失败后改组,Matt Mullenweg 已重新掌控公司。
TechCrunch
·2026-09-15 00:01:44
18
web3: OKX在New Money App上线70余只代币化美股
OKX在 New Money App 上线 70 多只代币化美股和 ETF,面向符合条件地区用户开放,并新增交易机器人功能。
The Cryptonomist
·2026-09-15 00:01:41
17
web3: 美国参议院修订Clarity Act争取跨党派支持
美国参议院公布新版《Clarity Act》,新增更严官员加密资产伦理限制,并调整 DeFi 与稳定币条款,力争通过程序性投票。
Coinpaper
·2026-09-14 23:35:30
17
查看更多