美国法院本周解封的一批文件,披露了微软与 OpenAI 围绕 AI 训练数据的内部讨论。多份材料显示,两家公司员工曾私下质疑,抓取新闻内容训练模型是否等同于未经许可使用他人劳动成果。这些内容已成为《纽约时报》起诉两家公司的版权案新焦点。
内部文件曝光分歧
据《纽约时报》和 TechCrunch 报道,微软应用科学总监 Brent Hecht 曾在 2023 年内部文件中写道,大模型大规模吸收他人作品,可能会被外界视为“人类历史上最大规模的劳动盗窃”。
另一份 2024 年 1 月的内部演示材料则提到,AI 产品可能正在破坏自身内容来源。文件将这一现象称为“末日循环”:像 Copilot 这样的 AI 回答工具削弱新闻网站流量,进而影响未来可供训练的高质量内容供给。
解封材料还显示,微软内部数据称,与传统 Bing 搜索结果相比,导向《纽约时报》网站的点击率最多下降 93%。文件将这一变化描述为对内容供应方经济基础的威胁。
OpenAI聊天记录被引用

OpenAI 方面,一段内部对话也被纳入法庭记录。文件显示,有员工提到曾制作一个绕过《纽约时报》付费墙的“hack”,OpenAI 总裁 Greg Brockman 回复称“ah nice”。这一表述随后成为外界关注的重点,因为它削弱了“相关行为只是偶发情况”的说法。
《纽约时报》于 2023 年底起诉微软和 OpenAI,指控两家公司未经授权使用其新闻内容训练生成式 AI 系统。此后,已有 11 家出版机构加入诉讼,使案件从单一媒体纠纷扩大为出版业与 AI 公司之间的版权争议。
目前,该案由纽约南区联邦地区法院法官 Sidney Stein 审理。随着更多密封材料被公开,法院也在审查双方提出的简易判决动议。诉讼过程中,OpenAI 还被要求保存 2000 万条 ChatGPT 对话记录。
纳德拉证词受关注
微软表示,Hecht 的文件只代表个人分析,并不构成公司正式政策。公司称,他的职责之一就是提出不同视角,因此相关表述不能代表微软决策层立场。
不过,微软 CEO 纳德拉在证词中的说法引发更多关注。他表示,凡是设有付费墙的内容,若要用于训练或支撑 AI 系统,就应获得授权;如果他当时知道 OpenAI 使用了付费墙内容训练模型,微软本可要求其重新训练模型。
OpenAI 的主要法律抗辩仍是“合理使用”。公司认为,训练过程是对原始内容的转化,而非直接替代原作。但解封文件中的内部表述对这一说法形成压力。材料显示,部分员工曾警告,AI 产品会越来越像原内容的替代品,而不是为出版商带回流量。
随着更多内部文件进入公开记录,这起案件的争点已不再只是 AI 训练是否受版权法保护,也涉及科技公司是否早已意识到相关做法可能冲击新闻行业的商业模式。











