最近海外科技媒体404 Media 爆出一件特别有意思的事。一家叫 ISBNdb 的图书数据公司,开始向 AI 公司推销一项服务:帮你按书单从旧书店、图书馆批量找实体书,一次能买1000本到100万本。它的广告语很直白:“世界上最好的 AI 训练数据,正躺在书架上。”而且它们特别看重2022年以前出版的书。
你可能会奇怪,AI 都快把整个互联网读完了,为什么还要回头找纸质旧书?
原因是这样的:2022年底 ChatGPT 发布之后,大量 AI 生成的文章开始回灌互联网,行业里管这叫“AI 泔水”。今天 AI 从网上抓到的一篇文章,很可能是另一个 AI 根据第三个 AI 的总结改写出来的。如果下一代模型不断拿上一代模型的输出来训练自己,就像拿复印件继续复印,细节会越来越模糊,研究者把这种风险叫“模型崩塌”。
虽然经过筛选的 AI 合成数据也能用于训练,但问题是今天的互联网已经很难分辨哪段话是人写的、哪段是 AI 写的。这时候,一本2022年以前印出来的书就变得特别:不管写得好不好,它至少是纯粹由人类写出来的,在 AI 爆发之前就固定在纸上了。AI 公司表面上买的是旧书,真正要买的是一批有出处、有时间戳、确认来自人类的文本。
更魔幻的是 Anthropic(就是做 Claude 的那家公司)的操作。它早年从盗版网站下载过数百万本电子书,后来版权风险越来越大,从2024年开始花数百万美元批量购买实体书,把书脊切掉,书页送进高速扫描仪变成数字文件,纸书随后销毁。这个项目叫“巴拿马项目”,目标听起来像电影台词:破坏性扫描全世界所有的书。当然了,这种破坏书的行为也引起了众怒。
2025年,一名美国联邦法官做了一个很微妙的判断:合法买来的书转成内部数字副本、原件销毁,属于合理使用;但从盗版网站直接下载几百万本书,不属于合理使用。Anthropic 后来拿出15亿美元和解了盗版书库带来的集体诉讼,2026年7月法院批准了这项和解。
这等于给整个行业画了一条路线:盗版风险太大,那就去市场上合法买实体书。ISBNdb 看到的正是这门生意。虽然被报道后它撤下了服务页面,说只是需求探索,但只要 AI 公司还需要大量确认由人类写作、编辑、出版的文本,市场就会继续找下一家中间商。
这件事最值得关注的一点是:AI 时代真正稀缺的,可能是高价值的内容。文字变多,不等于有价值的数据变多。一本旧书值钱的地方在于,有人决定这个题目值得写,有人花几年搜集材料,有编辑判断该保留什么,读者又用购买和讨论做了一轮筛选。这套流程留下了来自真实世界的选择记录。
机器越会生产内容,那些能证明“这确实是人写的”内容就越值钱。这样的数据也不仅限于旧书,企业多年积累的买家秀、生产数据、退货记录,都可能是数据富矿。以后最昂贵的数据,未必是最秘密的,也未必是数量最大的,可能是那些能说清楚从哪里来、由谁判断过、为什么值得相信的数据。
#科技先锋官# #How I AI#
发布于 山东
