Linux内核代码托管平台 `git.kernel.org` 正面临极其严重的 AI 爬虫资源掠夺问题。管理员披露,尽管合法的开发者访问仅占总流量的 2%,但服务器每天接收到约 600 万次请求,其中绝大多数来自 AI 训练数据爬虫。为了满足这些爬虫低效的抓取方式——逐个提交渲染 HTML 页面而非直接使用 Git 协议克隆代码库,服务器 90 个 CPU 核心中长期有 14 至 16 个核心(约 20% 算力)被占用。爬虫之所以疯狂抓取,是因为 Linux 内核历史是未经 AI 生成内容污染的“纯净数据”金矿。为了应对这一问题,平台方尝试了封禁 IP、ASN 部署等手段,并引入了名为 Anubis 的算力挑战机制。尽管该机制拦截了 66% 的请求,但仍有 34% 的爬虫不惜消耗算力通过验证。由于攻击流量现已转向数百万个随机住宅 IP(如智能电视),封禁已失去意义,平台可能被迫削减匿名访问功能以维持服务稳定。
事件分析
核心观点:AI 对纯真人数据的饥渴导致开源资源被掠夺性抓取,正迫使互联网基础设施从“默认开放”走向“设防生存”的防御模式。
原文链接:Hacker News

评论前必须登录!
立即登录 注册