亚马逊正大批购入纸质书籍,扫描后直接销毁原书,这些珍贵的知识宝藏正在变成AI训练的数据燃料。
当地时间8月17日,外媒404 Media公布了一次追踪调查。调查人员把苹果藏进一批珍贵书籍的货件中,一路追踪这些书在美国境内的去向。
货件最终抵达亚马逊位于拉斯维加斯的一座仓库。仓库内有一支名为VGT3的团队,标志是一只手拿书本的霸王龙。
员工透露,为了提高扫描效率,他们会先切掉书脊,原书在处理过程中被彻底毁掉。扫描得到的数据随后被用于训练亚马逊的Nova大模型。
一些书商怀疑AI公司正在按照ISBN编号,系统性地逐本扫描出版过的书籍。这一行为引发了一场版权诉讼。
图书作者的诉讼披露了Google内部的"巴拿马计划"。该公司同样从电商平台购入书籍,切除书脊,再将内容数字化。
审理该案的法官裁定,这类扫描属于合理使用,不构成版权侵权。裁决依据是纸质原件已经被销毁,不存在原书复制后再出售的情况。
纸质书的价值尤其突出。许多内容从未出现在互联网上,是真正的数字盲点。这些书籍承载着大量未被公开的知识财富。

更关键的是,大量书籍出版于2022年以前。这意味着它们不含AI生成内容,是纯粹的人类创作成果。这类数据对训练高质量的AI模型至关重要。
亚马逊和Google都在把部分珍贵书籍转化为企业私有的AI训练材料。这种做法正在改变知识的获取方式。
争议的核心在于知识垄断。一些被毁掉的原书可能根本无法替代,原本能够留在公共书架上的知识也随之消失。
这些珍贵的知识最终只被封存在单一公司的封闭AI模型内部。普通用户无法直接访问这些书籍的原始内容。
你只能通过与这些AI模型的交互来获取信息。知识从公共资源变成了企业私产,这是一个巨大的转变。
许多作者发现自己的作品被扫描数字化后并没有获得任何报酬。他们不知道自己的书被哪家AI公司购得,也不知道用在了哪里。
这种批量扫描的行为可能影响书籍的市场价值。当原书被销毁,稀缺性丧失,二手书市场也会受到冲击。
这场关于书籍数字化和知识垄断的争论还在持续。AI公司认为这是合理使用,作者和出版商则认为损害了创作者权益。
知识应该如何才能在技术进步和公共利益之间取得平衡?你更愿意保留纸质书,还是接受AI模型中的数字化内容?欢迎在评论区分享你的看法。