微软内部文件曝光:AI抓取新闻训练被指史上最大规模劳动成果盗窃
微软应用科学总监Brent Hecht在内部文件中警告,抓取新闻内容训练AI可能是人类历史上最大规模的劳动成果盗窃,不符合合理使用原则。数据显示部分新闻出版商网站点击率下降83%-93%,OpenAI爬虫曾被指绕过《纽约时报》付费墙。
AI训练数据的合法性问题再度引发关注。据内部文件披露,微软应用科学总监Brent Hecht对抓取新闻内容训练AI的做法提出了严厉批评。他认为,这种大规模抓取行为可能构成了人类历史上规模最大的劳动成果盗窃,并明确表示这不属于合理使用的范畴,甚至是对合理使用理念的嘲弄。
微软的另一份内部文件进一步指出,这种做法可能形成一种“恶性循环”,对AI模型和整个Web生态同时造成伤害。文件特别提到,OpenAI的产品如ChatGPT可能会危及新闻出版商的经济基础。而来自OpenAI和微软的数据均显示,这一预测正在成为现实。微软的数据显示,部分新闻出版商网站的点击率下降了83%至93%,其他新闻机构的点击率降幅也在51%至94%之间。
Hecht在文件中承认,几乎没有人希望自己创作的内容被以这种方式使用,也没有人因此获得报酬。这一表态揭示了内容创作者在AI时代面临的困境。与此同时,微软CEO萨蒂亚·纳德拉在作证时表示,AI公司不应该通过绕过付费墙来违反新闻网站的使用条款,强调了合规的重要性。
然而,OpenAI的内部信息却呈现出另一番景象。当一名员工通知总裁Greg Brockman,OpenAI的爬虫找到了绕过《纽约时报》付费墙的漏洞时,Brockman的回应是“好极了”。这一细节与纳德拉的公开表态形成了鲜明对比,也凸显了AI公司在数据获取过程中面临的伦理与法律挑战。