科技行业的AI竞赛从未像今天这样疯狂。为了训练更强大的语言模型,各大公司不仅需要海量文本数据,更开始觊觎那些承载着历史与思想的珍稀书籍。最近,一场由书商发起的“侦探行动”揭开了这一灰色产业链的冰山一角:一枚藏在古书中的AirTag,直接指向了电商巨头亚马逊的AI训练基地。这一发现不仅让书商们多年的怀疑得到验证,也把关于“AI原理”与“科技深度”的讨论推向了新的高度。
一本古书的沉默追踪
过去一年里,欧美图书圈一直流传着一个令人不安的说法:一些神秘买家批量采购珍稀旧书,到手后既不阅读也不转卖,而是拆开扫描再销毁。许多书商怀疑这些买家背后是AI公司,但始终缺乏确凿证据。直到404 Media的记者想出了一个笨办法——在一本被列入批量订单的珍稀书中,悄悄塞进一枚AirTag。
这枚小小的追踪器随着订单进入亚马逊位于拉斯维加斯的一座AI训练设施。设施内部团队的任务十分明确:把书从书脊上拆下、逐页扫描、然后丢弃。书商们愤怒地发现,那些曾经被精心收藏的绝版书、学术专著和历史文献,最终的下场不是图书馆,而是垃圾桶。
更令人讽刺的是,这个团队的仓库门标为VGT3,门上画着一只霸王龙正准备吞食一本书——似乎在向外界宣告“知识即食物”。这种对文化符号的戏谑化处理,让不少业内人士感到刺眼。对于这样一家以创新和客户体验为荣的科技巨头,这种操作无疑暴露了AI训练过程中的野蛮一面。
数据饥渴:为什么科技巨头盯上旧书
要理解这场“焚书炼AI”的风波,必须先看清大模型训练背后的数据逻辑。当前,互联网上的公开文本虽然庞大,但高质量、有深度的长文本越来越稀缺。尤其是那些经过时间检验的经典书籍,其逻辑结构、语言表达和知识密度远非普通网页可比。
AI原理决定了模型的能力上限很大程度上取决于训练语料的质量和多样性。如果只靠网络碎片化内容,模型输出就会显得肤浅、同质化。而稀有书籍中蕴含的独特措辞、复杂论证和跨文化知识,恰恰能让模型学会“深度思考”。亚马逊训练团队的批量购书行为,正是为了给其前沿模型补充“精神营养”。
然而,书中并无“抓取协议”来保护著作权或者物理实体本身。当科技公司以“合理使用”为名行数据搬运之实,书的存在价值被简化成了“可扫描的素材”。这不禁让人质疑:在科技深度上尽显优势的AI行业,是否正在以牺牲文化遗产为代价换取性能提升?
亚马逊的沉默与行业的默契
面对404 Media的曝光,亚马逊的回应异常简短,甚至没有正面提及“AI训练”字样。这种避重就轻的态度,与当年谷歌扫描图书项目引发诉讼时的情形如出一辙。科技公司似乎形成了一种默契:只要不公开承认,就不算彻底违规。
事实上,亚马逊并非唯一这么做的公司。此前有调查发现,Meta曾卷入购买盗版电子书库的事件;多家AI创业公司也被曝从版权机构批量采购书籍扫描件。只是这次,实体书的物理销毁让问题变得触目惊心。书本不再是“共享资源”,而是一次性耗材。
书商们对此痛心疾首,不仅因为经济损失,更因为许多书一旦毁掉就永远消失了。虽然数字化影像可以留存内容,但原版书籍的装帧、版式、批注和物理质感,本身就是重要的历史资料。用AI工具箱里的扫描仪快速把书拆解成数据,听起来高效,却丢掉了那种真正的“阅读的尊严”。
从偷书到拆书:谁有权决定一本书的命运
现代版权体系主要关注复制和传播,却很少考虑“物理破坏”。当科技公司花几十万美元买下一批绝版书,所有权确实归其所有——但将其销毁以换取数据,是否违背了图书作为文化载体的初衷?
这背后涉及一个更深层的问题:AI Agent技术在自动化采集数据时,是否需要考虑社会伦理?如果AI系统可以自行判断哪些书值得扫描,哪些可以烧掉,那么人类在文化传承中的角色就会被边缘化。更进一步,当大模型训练越来越依赖实体书扫描数据时,图书馆、档案馆的数字化工作反而显得更加理智和规范。
有趣的是,消费者似乎已经开始用脚投票。一些书商开始拒绝对AI公司出售大批量稀有书,并在订单备注中明确禁止“拆书扫描”。而科技公司也开始尝试建立合法的数据授权渠道,比如与出版社合作获取电子版,而不是购买旧书扫描后销毁。遗憾的是,这些措施尚属冰山一角,整个行业仍然处于野蛮生长的阶段。
智能工具的另外一面:从效率到伦理的追问
本次事件之所以引发广泛关注,不仅是商业贪婪的又一个例证,更是对“智能工具”双刃剑效应的集中呈现。一方面,AI技术确实带来了前所未有的生产力:书籍扫描、OCR文字识别、知识抽取等环节的自动化程度大大提升。另一方面,当这些工具被过度滥用,就有可能造成不可逆的文化损失。
认真审视科技深度,我们会发现任何一项新技术在创造价值的同时,都会附带隐性成本。对于AI公司而言,与其藏着掖着搞“秘密扫描”,不如公开数据来源、与书商和作者共享收益、建立可追溯的数字化流程。这不是道德绑架,而是让产业走得更远的现实选择。
我们不妨把目光投向更远的未来:如果下一代AI模型真的具备了“阅读”所有人类书籍的能力,那么这些书籍的电子副本应该保存在可信的公共数字图书馆中,而不是某个公司的私有服务器里。企业数字化转型中出现的各种问题,其实都在反复提醒我们:数据不是免费的午餐,每一页纸背后都有创作者的智慧与心血。
AI时代的收藏悖论:消灭者才是最大的收藏家
亚马逊事件还揭示了一个奇特现象:最热衷于收藏珍稀书籍的机构,不是图书馆,不是私人藏书家,而是AI公司。只不过,他们的收藏方式是将书拆开、扫描、喂给模型,然后把物理实体扔进碎纸机。这种行为看起来与“收藏”背道而驰,却恰好符合AI时代的逻辑——知识被编码成参数,纸本成为冗余。
但问题在于,数字参数会随模型迭代而遗忘,而纸质书却可以存在数百年。当AI公司销毁一本绝版书时,它实际上是在消灭一种“备份”。即便模型当前能记住书中的内容,未来的清算、模型重构或数据删除,都可能让这一切化为乌有。到那时,我们是否还有能力找回这些消失的知识?
书商们的AirTag实验也许只是开始。未来,可能会有更多技术手段用来追踪AI数据供应链。比如通过水印识别扫描文本的来源,或者利用区块链记录书籍的去向。不过,在监管尚未跟上之前,类似“毁书训AI”的行为恐怕还会继续发生。
作为科技媒体,我们愿意相信AI技术可以为人类带来更多知识,而不是加速知识的湮灭。如何在训练创意AI的同时保护文明遗产,是每一个从业者都应思考的问题。也许,下一次当你打开一个AI画图工具,生成一幅复古风格的画作时,不妨想想那些被拆解的古书——它们以另一种形式活在了数字世界里,但代价是永远失去了与人类指尖接触的机会。
这种牺牲值得吗?答案或许不在技术本身,而在于我们如何定义进步。如果智能工具只是让少数公司更快地控制知识流通,那这种进步是廉价的;如果它能让全人类更平等地共享知识,那才是真正的科技深度。希望亚马逊这次“霸王龙吃书”的logo,不要成为AI时代的文化墓志铭。