微软高管内部文件:AI训练或是史上最大规模"窃取"
来源:倍可亲(backchina.com)围绕生成式人工智能训练数据合法性的争议近日再度升温。一份在《纽约(专题)时报》版权诉讼案中解封的法庭文件显示,微软一名高级研究主管曾在内部讨论中形容当前大型语言模型的训练方式可能是“人类历史上最大规模的劳动窃取”,相关表述引发业界广泛关注。
此次曝光的言论来自微软应用科学总监布伦特·赫克特。根据最新公开的法律文件,赫克特在讨论微软、OpenAI以及其他人工智能企业利用互联网海量内容训练模型时,曾将这一过程称为“前所未有规模的惊人窃取”,并进一步表示这可能是“人类历史上最大规模的劳动窃取”。
这些内容出现在《纽约时报》及其他新闻出版机构针对微软和OpenAI提起的版权诉讼之中。原告认为,两家公司未经授权利用新闻报道和其他受版权保护内容训练人工智能模型,并借此开发商业产品。
微软和OpenAI则始终坚持其“合理使用”立场。两家公司认为,模型训练过程类似于学生阅读书籍学习知识,属于合理使用范畴。同时他们还主张,人工智能生成的内容已经对原始材料进行了足够程度的转换,因此不构成直接复制。
然而,最新解封文件中的部分内部交流记录似乎与这一公开立场形成明显反差。
文件显示,赫克特曾认为,如果要在诉讼中获胜,相关企业可能需要“彻底嘲弄合理使用这一概念”。这一表述被原告方面视为重要证据,并被用来质疑人工智能企业长期以来所坚持的版权辩护逻辑。
与此同时,文件还公开了部分来自OpenAI内部的讨论内容。其中一项记录显示,OpenAI联合创始人格雷格·布罗克曼曾承认,当模型接触《纽约时报》内容时,ChatGPT确实能够预测并续写相关文章中的句子。这类内容被原告用于证明模型具备重现原始作品的能力,而不仅仅是抽象学习信息。
诉讼文件还披露,赫克特对于人工智能产业长期发展的担忧并不局限于版权问题本身。他曾在另一份内部演示文档中提出所谓“末日循环”概念。
按照这一逻辑,人工智能答案引擎正在逐步减少用户访问新闻网站的需求,导致媒体流量下降、商业收入减少。随着越来越多内容生产机构失去生存能力,未来可供人工智能系统学习的优质信息来源也会随之减少,最终反过来损害模型和整个互联网生态。
他在内部文件中指出,一个产品会威胁其关键供应者的经济基础这种现象极为罕见,但人工智能行业目前正处于这种状况之中。由于新闻机构和内容创作者是AI模型的重要信息来源,当这些群体遭受冲击时,整个内容供应链都将面临风险。
原告方还引用微软内部数据称,Copilot等AI答案系统对部分新闻网站流量造成明显影响。在部分案例中,用户点击进入《纽约时报》页面的比例相较传统搜索结果下降超过90%。
事实上,关于训练数据来源的争议已经成为当前人工智能行业最重要的法律挑战之一。
OpenAI此前曾公开表示,在完全不接触受版权保护内容的情况下训练先进人工智能系统几乎是不可能完成的任务。Meta前高管尼克·克莱格也曾作出类似表态,认为如果严格按照传统版权规则执行,当前许多AI系统将难以维持发展。
与此同时,包括微软、Meta以及其他科技企业在内的多家公司,也持续因训练数据来源问题面临外界批评。一些企业曾被指利用用户内容、代码库、文章、图片以及其他网络资源训练模型,而相关创作者往往未获得明确授权或补偿。
随着《纽约时报》诉讼持续推进,越来越多内部文件正在被公开。业内人士认为,这些材料不仅关系到微软与OpenAI面临的版权诉讼结果,也可能影响未来全球范围内关于人工智能训练、知识产权保护以及内容生产者权益分配的监管方向。
目前,相关案件仍在审理过程中。无论最终判决结果如何,这场围绕人工智能训练合法性的法律争议,都正在成为决定未来AI产业发展规则的重要里程碑。
版权说明 / Copyright Notice:Content and images in this article may originate from third-party sources and are used for news reporting, commentary, or public interest purposes. All copyrights remain with their respective owners. Please refer to the Copyright Notice at the bottom of this page.
本文内容仅供信息参考,不代表倍可亲立场或观点。
评论 (0)