近期“AI焚书”事件引发全球关注——部分AI公司为获取纯净训练数据,购买大量旧书后采用破坏性扫描,随后将实体书销毁,这一行为被认为是在用毁灭文明载体的方式“喂养”AI,如何平衡技术进步与人类知识遗产的保护,成为亟需破解的难题。
一、完善法律法规与版权保护,禁止破坏性采集
明确版权边界:华夏出版社已在部分新书版权页印上“禁止将本书内容用于人工智能训练”的声明,这一做法正在被更多出版机构效仿,成为创作者和出版界面对AI无序抓取数据的防御性表态。
推动立法约束:目前针对AI训练数据的来源、授权和用户退出机制尚缺乏系统规定。业内呼吁建立一整套规则,包括训练数据从哪里来、是否需要授权、作者如何退出、商业使用如何付费等。
强化版权维权:在现行法律框架下,作者终生及去世后50年内有权禁止其作品被用于AI训练,但维权难度大、侵权发现困难,需要从举证责任和监管手段上加以完善。
二、建立行业技术伦理规范,以非破坏性方式替代
推广保护性扫描方案:马斯克已公开要求旗下Space X AI团队在图书馆中保留所有稀有书籍,采用困难但保护性的方式进行扫描,而不是切掉书脊破坏原件,这套做法值得全行业借鉴。
保留原件并存档捐赠:无损扫描后,将书籍捐赠给图书馆或公共机构,既能完成数据采集,又能保存实体文献的装帧、批注、纸张等不可复制的信息。这些实体特征往往承载着数字副本无法提取的历史价值。
建立版本筛选机制:AI公司在批量采购时应与图书馆、版本专家合作,识别并保护珍稀、绝版书籍,避免工业化的“一刀切”流程误伤稀缺版本。
三、提升公众与机构参与,筑牢知识遗产保护防线
读者与图书馆的参与:通过捐赠、收藏经典纸质书等方式,守护知识的实体载体。每本实体书的留存,都是对数字信息垄断的一种制衡。
学术与教育机构的示范:清华大学、复旦大学等高校已陆续发布AI使用指导原则,明确禁止AI代写论文,同时鼓励在文献检索、格式校对等环节合理使用AI工具,探索“人为主体、AI辅助”的协作模式。
构建多元知识存储体系:防止单一数字存储带来的风险,推进纸质文献与数字副本的“双轨并行”,确保即便在数据被篡改或丢失的情况下,原始知识仍有据可查。