微软应用科学总监 Brent Hecht 在内部文件里,把 AI 未经许可批量使用他人版权内容训练模型,定性为"人类历史上最大规模的劳动窃取"。同一时期,OpenAI 的 ChatGPT 负责人 Nick Turley 在内部通讯里把 ChatGPT 形容为对出版商的"存亡级威胁"。这些话不是记者偷录,是微软自己递交、又被《纽约时报》一方从法律文书里翻出来呈堂的。对外喊合理使用,对内承认是偷——两张面孔并排摆在法官面前。
微软应用科学总监私下那句"最大规模窃取",被挖了出来
OpenAI 和微软在法庭外讲的是一个故事,在自家内部文件里讲的是另一个故事。后者被 NYT 一方从法律文书中挖了出来。
《纽约时报》诉 OpenAI 案的质证阶段(双方交换证据的环节)刚翻出一组新文件。文件里记录着微软应用科学总监 Brent Hecht 在内部沟通中,把 AI 公司未经许可批量使用他人版权内容训练模型的做法,定性为"人类历史上最大规模的劳动窃取"。这四个字从微软自家总监嘴里说出来,份量不轻。
Hecht 在同一时期还说了句更具体的话:这件事的规模"前所未有,因为它的对象是每个国家、每种语言、每个领域的人类劳动成果"。换句话说,这是一场全球范围的"内容收割"——把别人写的东西、报道的东西、研究的东西装进 AI 模型,事前不打招呼,事后也不付钱。
对比很扎眼:同一家微软,对外是 AI 训练"合理使用"(即法律允许的无授权使用)的坚定支持者;对内却承认这套生意的底色是偷。法庭文件把这两张面孔并排摆在法官面前——一边是法律团队的抗辩词,一边是总监私下发的邮件。
这两句话都出自内部通讯,又随被告自己的材料进了法院卷宗——想否认,先得否认自家文件。
NYT 律师团还在 7 月 9 日单独向曼哈顿联邦法院申请制裁 OpenAI,指控后者在数据销毁和 ChatGPT 日志(即用户与 AI 的对话记录)问题上"选择阻挠"、持续"做出虚假陈述"达两年。
手里多了张什么牌?微软自己人都承认了,对手法庭上还在硬扛。
内部认了盗窃,公开还喊合理使用,这中间隔着一整套抗辩
OpenAI 在法庭上的核心抗辩是"合理使用"——训练数据来自公开网络、不直接复制原文、属于有社会价值的转换性使用。但同一时间,它内部已经把这套技术的杀伤力评估到了"存亡级"。
出版商要证明的不是抓取本身违法,而是被告明知有争议,仍对外宣称合法。这批内部文件的价值就在这里:它把"明知"两个字摆到了台面上。
一个技术对内容生产方是结构性、不可逆的冲击,被告自己门儿清,却选在台面上喊合理使用、台面下抢着把媒体绑上自家授权合作的车——这正是出版商一方想证明的"主观恶意"。
AI 公司批量抓取新闻、书籍、论文训练模型(用海量数据教 AI 学说话和写作的过程),是这一代 AI 产品的通用做法。
纽约时报带头的媒体联盟想要的不是封死 AI,而是给这个做法定价——要么付费授权,要么承担法律责任。案子打到这一步,证据的天平每倾斜一寸,受影响的不只是两家公司的赔偿数字,还有未来所有 AI 产品获取内容的方式和成本。
如果真信合理使用,何必在内部用"窃取"和"存亡"这种词?