欧洲书商遭神秘扫货,Anthropic被指大规模收购旧书用于训练Claude模型

近期,从爱尔兰高威到德国柏林,欧洲独立书商频繁收到“疯狂”的神秘订单,单次订购量高达5000本,金额动辄数万欧元。这些订单不仅规模庞大,且选书极其怪异,常将学术著作与过期的驾驶指南等冷门书籍混搭。书商们注意到,这些订单通常不议价,且似乎由AI机器人根据ISBN自动检索生成。业界普遍怀疑,这是AI巨头为了扩充训练数据而进行的“扫货”行动。此前《华盛顿邮报》曾报道,Anthropic启动“Project Panama”计划,耗资数千万美元购买并扫描数百万本书籍,甚至切掉书脊以提高效率,最终将这些数据用于训练其Claude聊天机器人。尽管Anthropic否认购买并销毁珍本,且声称遵守版权,但德国书商协会指出,在德国未经许可扫描书籍属于明显的版权侵犯。由于美国“合理使用”原则允许对受版权保护材料进行转化性使用,外界猜测这些书籍可能先在欧洲收集,再转运至美国进行扫描销毁。书商们担忧,这不仅破坏了二手书市场的生态,更助长了AI公司对人类知识库的掠夺式开发。

事件分析

这一事件揭示了AI大模型在面临“高质量数据荒”背景下的灰色数据产业链。当互联网公开数据被消耗殆尽后,科技巨头将目标转向受版权保护的实体书籍,试图通过“购买-销毁-扫描”的路径获取高质量文本数据。这种操作利用了美国“合理使用”的版权例外原则,与欧盟严格的版权保护法形成冲突,也反映了AI训练数据成本的结构性上升。技术视角看,这标志着数据获取方式从数字爬虫向实体资产收购的延伸,未来围绕版权授权与AI训练数据的法律博弈将更加激烈,拥有版权资源的出版商地位或将提升。

💡 核心观点:AI训练数据的枯竭迫使巨头从“网络爬虫”转向“实体销毁”,通过破坏性手段获取版权内容正在成为行业隐秘的生存法则。

原文链接:Hacker News

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册