为了训练 Claude,我们正在销毁珍贵的古籍:Anthropic“破坏性扫描”引发伦理争议

近期,一篇讽刺文学作品在科技圈引发热议,揭示了生成式 AI 发展背后令人不安的现实。文章以虚构的“Book Doug”视角,描述了其作为某 AI 公司“遗留媒体完成专家”的工作:在将珍贵的绝版书籍扫描进 AI 系统后,负责物理销毁这些人类文化遗产。尽管文章带有黑色幽默色彩,但其背景源于 Anthropic 等公司被曝光的真实操作。据报道,为了满足大模型对高质量训练数据的饥渴,这些公司购买实体书籍,切除书脊以分离书页进行高效扫描,随后将纸质残骸粉碎处理。这种被称为“破坏性扫描”的手段,虽然能极大提升数字化效率,却意味着独一无二的历史原件永久消失。文中主角甚至将此辩解为“规模化”与“效率”的胜利,认为将孤本转化为可搜索的数据库并限制访问权限是符合商业逻辑的。这一事件不仅暴露了 AI 巨头在数据获取上的激进策略,更引发了关于版权保护与文物存亡的深刻危机。

事件分析

从技术路径来看,AI 模型对高质量文本数据的依赖已深入骨髓,当互联网公共数据被耗尽,受版权保护的书籍成为最后的必争之地。物理拆解书籍虽然看似野蛮,但在 OCR(光学字符识别)精度和自动化吞吐量上具有技术优势,能将数字化成本降低至极限。这一事件反映了 AI 产业原始积累阶段的残酷性:算力进化的代价往往是物理载体的消亡。随着版权诉讼如针对 Anthropic 的案件逐渐浮出水面,这种激进的数据获取方式正面临法律挑战。未来,AI 公司可能被迫从“破坏性扫描”转向版权购买或合作授权,但在监管完善之前,古籍作为数据的牺牲品已在所难免。

核心观点:“破坏性扫描”揭示了 AI 训练对高质量数据的无度索取,算力进化的背后正在上演数字吞并物理载体的残酷寓言。

原文链接:Hacker News

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册