近日,一则关于亚马逊销毁书籍用于训练AI工具的新闻引发广泛关注。调查人员利用苹果AirTag追踪到,亚马逊将购入的珍贵书籍切掉书脊后扫描,随后直接销毁原书,所获数据用于训练其Nova模型。这一事件不仅暴露了AI工具训练中的资源获取方式,更引发了关于知识私有化与版权保护的激烈讨论。以下从多个角度深入分析。
追踪真相:AirTag如何揭露亚马逊的“毁书”行动
事件的起点源于一次看似普通的快递追踪。外媒调查人员将一批苹果AirTag藏入多本珍贵书籍的货件中,这些书籍来自不同书店,目的地却指向同一坐标——亚马逊位于拉斯维加斯的一座仓库。当快递被签收后,AirTag信号稳定在仓库内部,显示书籍并未被上架销售,而是进入了某个特定区域。
深入调查发现,该仓库内有一支代号为VGT3的团队,其标志是一只手持书本的霸王龙,颇具讽刺意味。团队员工透露,他们接到的工作指令非常简单:将书籍的封面与书脊切除,然后通过高速扫描仪将每一页内容数字化。完成扫描后,剩余的纸张堆被直接送入碎纸机,原书在物理上彻底消失。亚马逊发言人后来承认,公司通过正常商业渠道采购书籍,用于“改进产品”——实际就是训练其自研的Nova大模型。
这一追踪手段揭示了AI工具训练数据获取的隐秘链条。传统上,大型科技公司通过爬取互联网公开数据来训练模型,但互联网上的文字内容有限,且大量出版于2022年之后,充斥着AI生成内容,质量参差不齐。而纸质书籍,尤其是那些出版于2022年以前、未经数字化的图书,被视为“高质量训练数据”的宝库。亚马逊的做法并非孤例,AI Agent技术的快速发展催生了更多企业效仿。
扫描与销毁:AI工具训练背后的资源掠夺
为何要采取“切掉书脊—扫描—销毁”这种极端方式?从技术角度看,扫描纸质书时,书脊处的弯曲会导致页面变形,影响OCR识别精度。直接切除书脊后,每一页都能平整地通过自动进纸器,大幅提升扫描效率。但对于图书本身而言,这意味着不可逆的破坏——一本被切除书脊的书,即使内容被数字化,其物理形态也永远消失了。
更令人担忧的是,这种“数字化即销毁”的做法正在系统化。一些书商怀疑,AI公司正在按照ISBN编号逐本扫描所有出版过的书籍。亚马逊的Nova模型需要海量训练数据,而纸质书的价值在于它们包含大量从未出现在互联网上的内容,同时避免了AI生成内容的污染。然而,这种掠夺式的数据采集方式,与企业数字化转型中倡导的“可持续创新”理念背道而驰。
值得注意的是,Anthropic公司也执行过类似项目,内部代号“巴拿马计划”。该公司从电商平台购入书籍,同样切除书脊后数字化。这些行为揭示了一个残酷现实:在最新科技浪潮中,AI工具的训练需求正在驱使科技公司以近乎“焚书”的方式获取数据。AI工具箱中不乏开源数据集,但大公司依然选择这种高成本手段,因为独家数据意味着模型性能的护城河。
法律与争议:合理使用还是版权侵犯?
围绕“毁书”行为的法律争议,在法庭上得到了一个令人意外的裁决。审理Anthropic相关案件的法官裁定,这种扫描行为属于合理使用,不构成版权侵权。裁决的一项关键依据正是:纸质原件已经被销毁,因此不存在原书被复制后再次出售的情况,也就不会对原书市场造成损害。
这一逻辑引发轩然大波。批评者指出,销毁原件恰恰是问题的核心——它阻止了知识以物理形式继续流传。如果只是“扫描+保存原件”,那还可以视为知识备份;但“扫描+销毁”则意味着知识被彻底私有化。更讽刺的是,一旦原件被销毁,AI公司就可以声称“没有复制行为”,因为原书已不存在,数字化版本成为唯一的“原件”。这种法律漏洞可能被更多AI工具训练项目利用。
从版权法角度看,合理使用通常考虑四个因素:使用目的、作品性质、使用比例、对市场的影响。但本案中,法官似乎过度强调了“原件销毁”这一事实。实际上,AI公司不仅获得了商业利益(通过训练模型),还消灭了未来可能流通的二手书市场。如果这种模式被推广,出版社和作者将面临更严峻的挑战——他们可能永远无法知道自己的书被“毁掉”了。
行业影响:AI技术发展下的知识私有化隐忧
更深层的影响在于知识传播的生态。一本被销毁的珍贵书籍,可能来自私人图书馆、小型出版社,甚至是绝版珍藏。它们原本属于公共知识领域,任何人都有机会借阅、购买或参考。但一旦被数字化并封存在AI公司的封闭模型内部,这些知识就变成了只有少数人才能通过API调用的“私有商品”。
这与AI画图领域的争议如出一辙——当训练数据来自未授权的图片时,生成的作品隐含了版权纠纷。但书籍销毁问题更严重:它直接消灭了物理载体。试想,如果所有出版于20世纪的小说都被亚马逊买去扫描销毁,几十年后,图书馆里可能再也找不到原版,只能通过AI模型“生成”一个近似版本。知识的原真性将荡然无存。
一些图书馆和档案馆已经开始行动,试图通过数字化存储来对抗这种趋势。他们利用抠图技术清理扫描瑕疵,将古籍转为高清电子版,并开放给公众使用。但这一过程需要大量资金和人力,远不及科技公司直接购买销毁来得高效。AI工具导航上虽然有很多免费的开源OCR工具,但质量参差不齐,难以满足大规模精细化需求。
未来展望:如何平衡AI训练与知识传承?
面对这一困境,科技行业需要重新思考训练数据的获取伦理。完全禁止使用纸质书数据既不现实,也会阻碍AI技术发展。但“买书即销毁”的做法必须被制止。一个可行的折中方案是:AI公司可以采购书籍进行扫描,但必须保留物理原件,并捐赠给公共图书馆或档案馆。这样既能获得训练数据,又能保存知识载体。
此外,版权制度也需要与时俱进。当前法律对“数字化复制”和“物理销毁”的界定过于模糊,导致AI公司钻了空子。立法者应当明确:即使原件被销毁,数字副本仍属于复制行为,且应支付合理版税。同时,建立“AI训练数据登记制度”,公开每本书的使用去向,让作者和出版社能够追踪自己作品的使用情况。
对于普通读者和创作者而言,这一事件也是一个警示:在享受最新科技带来的便利时,也要警惕其背后的代价。AI诗词生成器可以模仿李白杜甫,但它的训练数据可能来自某本被销毁的古籍。当我们用AI工具生成内容时,或许应该问问:这些数据从何而来?它是否经历了不可逆的破坏?
最终,科技的发展不应以牺牲人类文化遗产为代价。亚马逊的AirTag暴露了AI工具训练中的暗面,但这也是一次推动行业走向透明与伦理的契机。只有平衡好创新与传承,AI技术才能真正成为人类文明的助推器,而非掘墓人。