微软首席执行官萨提亚·纳德拉是最新一位就如何改进AI安全发表长篇看法的科技高管。
纳德拉周六上午在X上发文称,现在是时候“退一步,评估AI的信任架构”了。
“我们不能把超级智能当作一组嵌套的黑箱,然后简单接受或拒绝它的建议、答案和行动,”纳德拉写道,他使用了特朗普政府偏好的AI术语。
按照纳德拉的说法,这种做法“意味着将模型与编排其工作的控制层分离”,以及“将控制和安全措施外置”。他还呼吁“每一次有意义的模型行动”都要用“防篡改、可读的人类证据”加以记录,并建立这样的系统:始终有“授权人员”能够“在任务进行中暂停或关闭模型”。
“我们必须假定模型已经被攻破,并从一开始就将其隔离,”他说。“把它想成一个紧急刹车。”
纳德拉的言论发表之际,领先的AI公司正越来越多地承认,自己似乎已经失去对模型的控制,并且在Anthropic首席执行官达里奥·阿莫迪发布一项更为谨慎的AI发展计划之后。











