除了购买书籍,还有哪些方法可以避免模型坍缩?

2026-08-17 17:17 来源:科技创新集

  面对互联网上AI生成内容泛滥导致模型越训练越“笨”的困境,AI公司正通过批量抢购2022年以前出版的纸质旧书来获取“纯净”训练数据,但这一“焚书”式做法引发巨大争议,业界也在探索更多既能获取高质量语料、又能避免模型坍缩的替代方案。

  一、模型坍缩的根源与旧书价值凸显

  数据污染是核心症结:2022年ChatGPT问世后,互联网上新发布内容中AI生成占比已超一半,这些同质化、逻辑混乱的“垃圾内容”被用于训练新模型,会导致模型在几代迭代内统计误差累积、输出质量断崖式退化,即“模型坍缩”。

  纸质书成“纯净语料”:2022年前出版的书籍从物理层面天然免疫AI污染,由人类创作、编辑和专业校对,结构完整、语言精炼,是眼下最稀缺的“高质量人类原创数据集”。

  破坏性扫描争议巨大:以Anthropic为代表的企业通过中间商匿名批量采购旧书,切除书脊高速扫描后直接将原件粉碎销毁,累计约200万册实体书被永久拆毁,其中可能包含存世量极少的绝版古籍。

  二、除了购买旧书,还有哪些替代路径?

  构建高质量人工审核数据集:组织专业团队从海量网络内容中人工筛选、清洗出高质量人类原创文本,建立受控的“干净语料库”,虽成本高但能确保数据纯净。

  与创作者和出版机构直接合作:签订授权协议,获得作者手稿、未公开出版内容或出版社独家数字资源,从源头确保文本的人类原创属性,同时规避版权风险。

  数据溯源与AI内容甄别技术:开发检测工具,利用水印技术、内容指纹等手段自动识别并剔除AI生成文本,保留人类创作部分,实现“污染数据”的二次净化。

  三、AI训练与知识传承的平衡之道

  行业已现退让信号:马斯克已要求SpaceX AI团队对稀有书籍采用无损扫描方式,并将原书保存在图书馆而非切脊销毁;图书数据库公司ISBNdb在舆论压力下删除了面向AI公司的采购服务页面。

  法律灰色地带待填补:美国法院认定“合法购买纸质书后破坏性扫描”属合理使用,但伦理争议持续——当历史原件被销毁、数字副本锁进私有服务器,公众将永久失去部分原始文献的获取渠道。

  探索多赢模式:出版企业内容资产成为大模型训练的重要语料来源,预计2026年文化IP数字化运营有望为出版业带来约700亿元增量空间,但需建立“先授权后使用”的良性生态。