近期全球二手书市场出现大批神秘买家,以不议价、无主题规律的方式疯狂扫货2022年之前出版的旧书,背后疑为AI公司争夺“未被AI污染”的纯净人类原创语料。
一、核心原因:互联网数据已被AI内容“污染”
AI垃圾内容泛滥:2022年ChatGPT爆火后,互联网新发布内容中AI生成占比已超过一半,机器产出的低质文本大量混入数据池。
旧书成为“纯净语料”:2022年前出版的纸质书在物理层面天然免疫AI污染,内容全部由人类创作、编辑和校对,结构完整、语言精炼,是当下最稀缺的高质量人类原创数据集。
规避“模型崩溃”:若持续用AI生成内容训练新模型,机器会因吞噬自身输出导致性能退化,陷入“自己抄自己”的死循环,最终输出空洞、逻辑混乱。
二、商业考量:构建独家数据壁垒
公开数据即将耗尽:据测算,语言模型将在2026—2032年间耗尽公开高质量文本,AI公司急需独家数据建立优势。
批量买断长尾纸质书:冷门书、绝版书、地方志等被扫描后锁入私有数据库,形成独家“纯净语料”壁垒。
规避版权谈判成本:美国法院裁定“合法购书后内部数字化”属合理使用,批量收购并销毁原件可绕开繁琐的版权协商。

三、操作方式:匿名采购与破坏性扫描
中间商匿名扫货:AI公司通过层层中间商(如加拿大的Zoom Books、新加坡的2077AI等)低调对接各地二手市场,单笔订单可达数千至百万本。
破坏性扫描:切掉书脊、高速扫描提取文字,原件随后被粉碎销毁,效率高且成本低。
争议焦点:大量绝版、稀有书籍在扫描后永久消失,人类公共知识被转化为企业私有资产,引发文化保护担忧。马斯克已公开要求团队对珍稀书籍改用无损扫描。