被AI“吃掉”的互联网:老牌数据网站遭AI爬虫与攻击瘫痪始末

本文详述了权威影视票房网站 The Numbers 在 2026 年 3 月突然瘫痪的深层原因。该网站不仅是被海量 Agentic AI 爬虫压垮了服务器,更疑似遭受了利用 AI 工具进行的网络攻击,攻击者意图提前获取数据以在预测市场(Polymarket)中套利。文章指出,随着 AI 大模型和 Agent 的普及,互联网流量结构已发生质变:AI 爬虫对内容的掠夺式抓取(Anthropic 爬取与回馈比例高达 38000:1)不仅让网站面临巨额带宽账单,更导致了直接流量的断崖式下跌。同时,AI 降低了黑客攻击的技术门槛,使得拥有 30 年历史代码库的网站成为自动化攻击的活靶子。从 Wikipedia 到 Read the Docs,大量站点正面临这种“双重挤压”,互联网原本基于“开放与共享”的基石正面临崩溃。

事件分析

该事件揭示了互联网基础设施在 AI 时代面临的系统性风险。技术层面,传统的 Web 服务器架构和老旧代码库根本无法抵御 Agentic AI 带来的高强度并发请求和自动化漏洞扫描。产业层面,原有的“搜索引擎抓取-流量回馈”经济模型已彻底破产,AI 公司对数据的无偿掠夺与数据维护者的高昂成本形成了不可调和的矛盾。未来,为了生存,网站运营者将不得不实施严格的反爬虫策略或转向付费 API 模式,这可能导致互联网从“开放网络”退化为无数个被付费墙和防火墙隔离的“数据孤岛”,开源生态与公共知识库将面临严重的生存挑战。

💡 核心观点:当 AI 摧毁了开放互联网的互惠契约,为了生存,数据孤岛化将成为所有网站运营者的必然选择。

原文链接:Hacker News

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册