如何看待AI公司购买书籍销毁这一行为?

2026-08-17 17:17 来源:光年亲历录

  一、事件全貌:从“抢书”到“焚书”的隐秘产业链

  异常订单涌现:英国、美国、荷兰、爱尔兰等多国二手书商近期收到大量无主题、不议价的大宗订单,单笔从数千本到上万本不等,有书商销量暴涨约5倍。

  采购模式:AI公司通过中间商(如加拿大Zoom Books、新加坡“2077AI”机构)匿名采购,按ISBN编号批量扫货,订单规模从1000本到100万本不等。

  销毁流程:书籍被液压机切掉书脊、送入高速工业扫描仪提取文字,完成后实体书直接粉碎回收,整个过程被称为“破坏性扫描”。

  核心目标:锁定2022年前出版的书籍,因其不含AI生成内容,是训练大模型最稀缺的“干净”语料。

  

  二、驱动因素:数据污染倒逼AI企业“回头啃书”

  互联网数据被AI“污染”:2022年ChatGPT爆火后,AI生成的低质内容充斥全网,若继续用其训练新模型,会导致“模型崩溃”,输出质量断崖式退化。

  纸质书成“最后净土”:2022年前出版的实体书全部由人类创作、编辑和校对,结构完整、语言精炼,是物理意义上天然免疫AI污染的稀缺资源。

  法律“绿灯”助推:美国联邦法院裁定,合法购买纸质书后破坏性扫描并销毁原件属于“合理使用”——销毁原件意味着同一时间只存在一份副本,不构成版权侵权。

  三、争议焦点:技术进步与文明传承的失衡

  知识被私有化:扫描后的数字内容仅存于AI企业私有数据库,公众无法访问,全人类的公共知识被资本垄断为“私有资产”。

  绝版书永久消失:大量存世量极少的冷门文史资料、地方志、绝版教材被买断销毁,实体载体一旦消失便无法复原,文化碎片就此断绝。

  行业警示:多家AI企业正通过中间商大规模扫货,有出版商已在版权页增加“禁止将本书内容用于AI训练”声明,AI训练数据的版权规则亟待建立。