AI 数据饥渴的代价:科技公司被曝批量收购并销毁珍本书籍以训练大模型

据科技媒体报道,为争夺高质量训练数据,多家 AI 科技公司正通过特定渠道批量购买珍本实体书籍,并在完成扫描后销毁原件。数据显示,2022 年以前出版的图书因不含 AI 生成内容,被视为高价值“纯净”数据源,备受 Anthropic 和谷歌等巨头青睐。服务提供商 ISBNdb 被曝在此类交易中扮演关键角色,不仅提供批量采购和匿名买家服务,还主动建议客户签署保密协议(NDA),并将破坏性扫描美化为“数字保护”。此前已有联邦法官裁定,只要在扫描过程中销毁原件,确保同一时间仅有一个副本存在,该行为即属于版权法中的“合理使用”。然而,这一商业逻辑正在造成不可逆的文化损失,包括历经战火与百年的孤本史料正因 AI 训练需求而永久消失,引发了关于技术进步与文化遗产保存的激烈争议。

事件分析

这一事件揭示了当前大模型发展面临的“高质量数据饥渴”及其引发的深层伦理与法律冲突。随着互联网公开数据逐渐枯竭且充斥 AI 生成内容,实体书籍成为稀缺的纯净数据源。技术路径上,虽然“割裂书脊”的扫描方式能提升效率,但物理载体的毁灭导致了不可逆的文化资产流失,这与企业标榜的“数字保护”背道而驰。产业层面,企业利用版权法中“合理使用”的模糊地带,通过销毁原件来规避版权风险,并通过 NDA 隐匿交易行为,显示出该模式在法律与道德上的脆弱性。未来,随着文化保护意识的觉醒,这种依赖物理销毁的数据获取模式可能面临更严格的立法限制,促使行业转向更规范的数据授权合作机制。

💡 核心观点:以“数字保护”之名行毁灭之实,将人类文明的实体记忆视为消耗性燃料,暴露了 AI 巨头在数据狂飙中技术伦理的彻底失守。

原文链接:Hacker News

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册