硅谷AI竟为数据焚书百万,马斯克强硬表态:绝不效仿毁灭文明之举

在阅读此文之前,辛苦您点击一下“关注”,既方便您进行讨论和分享,又能给您带来不一样的参与感,感谢您的支持!

编辑:G

2026年7月,一则在硅谷流传的消息让全球文化界不寒而栗。

为了给AI大模型寻找“干净”的训练数据,美国AI公司Anthropic启动了一项代号为“巴拿马计划”的秘密项目——批量购买纸质书籍,切除书脊、破坏性扫描,然后将数百万册实体书全部粉碎销毁。

消息曝光后,连向来以“疯狂”著称的埃隆·马斯克都看不下去了。

7月27日,马斯克在社交平台X上紧急发声,明确要求旗下人工智能公司SpaceXAI必须将处理过的珍稀书籍保存在图书馆中,并以不损坏书籍的方式进行扫描。

他写道:“我已要求SpaceX AI团队将任何珍稀书籍保存在图书馆中,并以更费力的方式扫描它们,而不是直接切掉书脊扫描。”

“巴拿马计划”:一场“阅后即焚”的工业化焚书

这场“焚书”风波的源头,要从Anthropic的内部文件说起,这家由前OpenAI高管创立的AI独角兽,为了获取高质量训练语料,自2024年启动代号“巴拿马计划”的秘密项目。

内部文件写得很直白:“巴拿马计划是指我们破坏性扫描世界上所有书籍……我们不希望外界知道我们在做这件事。”

项目操作流程令人触目惊心:公司通过二手书批发商匿名采购全球各地的纸质书籍,利用液压切割机切除书脊拆分书页,依靠高速工业扫描仪完成文字提取。

一旦文本数据入库,所有实体原版图书统一粉碎制浆,不再留存任何实物,整个项目配套预算达数千万美元,服务商招标文件明确要求具备半年内处理50万至200万册图书的承载能力。

据披露,已有约200万册实体书在这一过程中被销毁,液压切割机切掉书脊,高速扫描仪吞掉内容,剩下的碎纸送进回收站——甚至包括存世量极少的绝版古籍。

更令人不安的是其运作规模,调查媒体404 Media披露,多家AI公司正通过数据中间商ISBNdb大规模收购二手图书,单次订单从1000本到100万本不等。

ISBNdb曾公开宣称可以接活儿给AI公司找书,从旧书店、图书馆和绝版书目录中一次采购1000至100万本纸质书,并通过保密协议藏住买家身份和采购书目。

随着舆论发酵,ISBNdb紧急删除了相关宣传页面,并发表声明称“从未购买、扫描或销毁过任何书籍”,但那不过是一场仓促的切割公关,与此同时,书商销量在数月内飙升了五倍。

为什么必须“毁书”?AI的“数据饥渴症”

AI公司为何宁愿毁掉实体书也要获取数据?答案指向一个它们自己制造的问题——互联网已经被AI生成内容污染了。

斯坦福大学2026年AI指数报告显示,自2025年初以来,新发布的互联网内容中AI生成比例已超过一半(51.72%)。

当AI模型用AI生成的内容继续训练时,就会发生“模型坍塌”——AI逻辑能力持续退化、事实错误增多、表达逐渐同质化。

2024年Nature封面论文用实验证明了这一点:研究者用Meta的OPT-125m模型输入一段关于14世纪教堂塔楼的维基百科文本。

第一代输出还在讨论建筑,第五代跑偏到语言翻译,第九代模型开始热情洋溢地介绍各种不存在的兔子物种。从教堂到兔子,只用了九次迭代。

相比之下,2022年大模型浪潮之前出版的纸质书籍,拥有无可替代的优势——内容完全源自人类原创,经过编辑层层校对,信息密度高、逻辑严谨,不存在AI生成内容的干扰。

ISBNdb在官方博客中直接点明:“2022年之前印刷的纸质书,在结构上保证没有受到过这种污染,仅此一点,就是巨大的优势。”

然而,获取这些“纯净语料”面临版权困境。直接对接出版社逐一洽谈版权授权,周期漫长、成本高昂。

Epoch AI的测算给出了明确的时间窗:语言模型将在2026年到2032年间耗尽人类公开的高质量文本数据。

而芝加哥大学开发的Nightshade工具能在图像中嵌入对人类视觉无影响但会让模型“中毒”的修改,其文本领域的同类工具也在发展之中。

Anthropic联合英国AI安全研究所的研究显示,只需250份精心构造的恶意文档,就能在数千亿token量级的语料库中为模型植入后门。

这意味着互联网上爬取的数据无法保证“干净”——只有纸质书,从时间线上就天然免疫。

于是,一条看似“合法”的捷径浮出水面:合法购买纸质书,扫描后销毁原件——美国联邦法院裁定这种做法属于“合理使用”范畴。

这场争议最吊诡之处在于——法律给AI公司开了一道“焚书许可证”。

2025年6月,美国联邦法官威廉·阿尔萨普作出裁决:大模型读取一本书是为了学习语言、知识和表达方式,再生成新的内容,这种用途具有“转化性”,属于“合理使用”。

至于合法购买的纸质书,公司扫描一本就销毁对应的实体书,只在内部留下数字副本,没有对外传播,因此也不构成侵权,真正违法的是从盗版网站下载电子书——获取方式不合法。

这套逻辑意味着:花钱买书,就能合法地让一本书在物理世界彻底消失。

Anthropic此前曾因从盗版网站下载超700万本电子书训练模型,与美国作家群体达成15亿美元的和解协议——这是美国有史以来金额最高的版权和解协议。

但和解尘埃落定后,“合法购买纸质书后破坏性扫描”的模式,法院认定属于合理使用。盗版有罪,毁书无罪。

更令人不安的是系统性风险,AI公司采购时“不区分”珍稀与否,一旦涉及“所有书籍”,流散于二手市场的珍本、带有手写批注的孤本,便可能因缺乏辨识机制而沦为牺牲品。

目前没有证据证明某本书在世界上的最后一册已经被AI公司销毁,但外界看不到采购清单,不知道哪些公司正在买书,更不知道书被送进切割机以前,有没有人检查过它还剩多少册。

一本绝版书从二手书架消失,可能永远不会再有人知道它曾经存在过,一位匿名图书卖家说得很直白:“这么做既能帮我清理那些本来就很难卖出去的库存,也能让我赚到钱。

但另一方面,我并不喜欢这些图书最终的用途,也不愿意看到一些稀有图书被直接打成纸浆。”

马斯克的“硬核承诺”:不做“焚书”帮凶

就在“焚书”事件持续发酵之际,马斯克的表态成为转折点。

7月27日,他在X上公开承诺:“我已要求SpaceX AI团队将任何珍稀书籍保存在图书馆中,并以更费力的方式扫描它们,而不是直接切掉书脊扫描。”

这一承诺剑指Anthropic的“切脊焚书”行径。马斯克要求旗下AI公司采用无损扫描方式,将珍稀书籍保存在图书馆而非销毁,虽然“费力”,但保留了实体书作为文明载体的完整性。

无损扫描成本远高于破坏性扫描——俯拍扫描仪或V型设备,一本薄书要花近半小时;而工业高速扫描仪几秒钟就能搞定一本,成本直接降到十分之一。

马斯克愿意为“体面”多付成本,这本身就说明问题。舆论迅速形成鲜明对比:一边是Anthropic用数千万美元买书、拆书、毁书,一边是马斯克要求“珍稀书籍保存在图书馆”。

同一个行业,两种截然不同的伦理选择。这一举动传递出明确信号:数据获取的伦理底线可以且应当被守住。

然而,马斯克的表态虽然掷地有声,目前仍局限于其个人企业的道德自律,在缺少强制立法的情况下,资本是否会主动选择成本更高的方案?答案不言自明。

如果司法持续默许“购实体书→破坏性扫描训练AI”的模式,全球创作者的著作权益将出现永久性法律漏洞。

一个靠“人类写的书”训练出来的AI,正在挤压人类继续写书的空间。训练用的是人的书,产出的是替代人的内容。循环往复,直到写书的人越来越少,书也越来越少。

Anthropic的“巴拿马计划”暴露了AI行业最深的悖论——AI越成功,人类原创数据越稀缺。

但解决“数据饥渴”不能以毁灭文明载体为代价,正如马斯克所警示的,技术进步不应以销毁文明载体为代价。

当一本书被切掉书脊、高速扫描、粉碎制浆,我们失去的不仅是纸张和油墨,更是无法替代的文明证据。

那些泛黄纸页上的批注、不同版本的细微差异、装帧工艺的历史信息——它们随着液压切割机的落下,永远消失了。

书籍不只是文字的载体,版本信息、批注、装帧、纸张质感——这些都是文化坐标。切掉书脊、扫完页面、原书销毁,你得到的是纯文本,失去的是文献的“肉身”。

技术可以迭代,文明不可逆损。马斯克的承诺之所以引发共鸣,正是因为它触及了科技与文明的底线共识:发展AI不能以牺牲人类文化遗产为代价。

Anthropic的“巴拿马计划”是一个隐喻:技术越发达,越需要回到文明的起点去汲取营养,但汲取的方式,不该是掘坟,朋友们你们怎么看?#发优质内容享分成##上头条 聊热点##夏日生活打卡季#

信息来源:

展开阅读全文

更新时间:2026-08-04

标签:科技   硅谷   强硬   数据   文明   巴拿马   书脊   纸质   书籍   模型   公司   珍稀   内容   图书

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号

Top