为了解决人工智能模型训练数据枯竭的问题, 科技公司转而利用旧书——但在这一过程中,大量旧版书却遭到了销毁。这是对人类文化遗产的破坏吗?问题似乎没那么简单。
新闻链接>>
AI巨头阅后即焚!“巴拿马计划”曝光,破坏性扫描全世界所有书籍
流水线切掉书脊、高速扫描、液压粉碎,约200万册纸质书就这么凭空消失。
7月底,美国《华盛顿邮报》根据法庭解封文件,抖出AI巨头Anthropic代号“巴拿马计划”的内幕:
这家估值千亿的巨头,在2024年初秘密启动项目,内部文件白纸黑字写着“破坏性扫描世界上所有书籍”,还附带备注“我们不希望外界知道我们在做这件事”。
8月5日,旧金山联邦法院批准和解协议,Anthropic掏出15亿美元(约101亿元人民币)了结集体诉讼。
101亿人民币罚款听着吓人,可分摊下来每本书的“焚毁成本”仅约750美元,换来的是人类原生语料,永久转化为大模型私有参数。
这哪是惩罚,分明是给“数字焚书”发了张营业执照。

工业化切书撕碎文明底线,纯净语料危机逼出野蛮行径。
资本家宁可彻底毁掉实体书也不留原件,背后暴露的是整个AI行业最头疼的命脉难题:纯净语料濒临枯竭。
随着互联网上AI生成内容比例突破半数,模型如果继续使用AI产出的数据进行训练,就会像反复翻印复印件一样出现严重语义失真,引发所谓的“模型塌缩”。
而在2022年之前出版的纸质图书,是物理层面绝对纯净的人类原生语料,书中每一个字都出自真人笔下,因而成了大模型提升能力的最后一片净土。
二手书商将2022年前的纸质书批量叫卖,Anthropic匿名大肆收购绝版地方志与初版文集。书本运抵仓库后,切割机精准切除书脊,打散的书页送入扫描仪,残存纸屑直接销毁。
美司法开绿灯滥用合理使用,15亿和解金买走焚书通行证。
真正让“巴拿马计划”肆无忌惮的,是美国司法体系对资本的纵容。加州北区联邦法院此前裁定,AI公司合法购买图书后将其数字化并用于模型训练的行为属于“合理使用”。
法官甚至声称,AI模型如同渴望成为作家的读者,学习作品是为了创作新内容而非取代原作。
这种荒谬的逻辑直接撕开了法律漏洞,认为只要购买了图书实体,就拥有包括切碎、销毁在内的绝对处置权。
创作者倾尽半生心血写的书,被AI公司几美元买下切碎销毁,用来训练模仿其文风的机器,而法院却宣称合规。
资本用百亿资金买断了法律责任,给整个行业树立了极其危险的先例。
警惕文化浩劫与知识私有化,中国绝不能在这场风暴中缺席。
这起丑闻绝非单纯的版权纠纷,而是一场关乎人类文明传承的生态危机。
研究机构测算,人类积累的纯净文本语料将在几年内被彻底耗尽,科技巨头为了抢夺资源,已将黑手伸向图书馆和绝版文献室。
古籍孤本和地方文献一旦切碎,其包含的版本价值与实体史料将永久归零。更可怕的是,人类数千年积累的公共知识财富,正被科技巨头以野蛮手段私有化为内部闭源参数。
面对这场语料争夺战,中国绝不能只当旁观者。
立法层面必须明确AI训练语料的采集边界,对绝版书与地方志设立红线。产业层面应鼓励建立本土高质量安全语料库。治理层面更要在全球规则制定中发出强音。
15亿美元的和解金,买不来对文明的尊重,只买到了资本的肆无忌惮。
当AI狂飙的代价是要靠粉碎纸质图书来喂养,这项技术就已经偏离了造福人类的初衷。
如果任由西方资本用切纸机的轰鸣声,去吞噬人类文明的载体,终有一天,机器会掌握所有语言,而人类却失去了历史的根基。
AI应当是文明的守护者与延续者,绝不能变成掠夺公共财富的野兽。我们必须用铁打的规矩与法律,守住属于全人类的知识净土。
评论 (0)