跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
前沿哨所

Linux内核官网遭AI爬虫狂轰滥炸,两成CPU算力被无端消耗

3 分钟阅读阅读(3)
赞助推荐 团队协作里的 AI 办公工作台

Linux内核代码托管平台 `git.kernel.org` 正面临极其严重的 AI 爬虫资源掠夺问题。管理员披露,尽管合法的开发者访问仅占总流量的 2%,但服务器每天接收到约 600 万次请求,其中绝大多数来自 AI 训练数据爬虫。为了满足这些爬虫低效的抓取方式——逐个提交渲染 HTML 页面而非直接使用 Git 协议克隆代码库,服务器 90 个 CPU 核心中长期有 14 至 16 个核心(约 20% 算力)被占用。爬虫之所以疯狂抓取,是因为 Linux 内核历史是未经 AI 生成内容污染的“纯净数据”金矿。为了应对这一问题,平台方尝试了封禁 IP、ASN 部署等手段,并引入了名为 Anubis 的算力挑战机制。尽管该机制拦截了 66% 的请求,但仍有 34% 的爬虫不惜消耗算力通过验证。由于攻击流量现已转向数百万个随机住宅 IP(如智能电视),封禁已失去意义,平台可能被迫削减匿名访问功能以维持服务稳定。

事件分析

这起事件揭示了生成式 AI 浪潮下开源基础设施面临的深层危机。其核心冲突在于“纯净数据”的稀缺性与获取成本之间的博弈。由于使用 LLM 生成的内容训练模型会导致“模型崩溃”,Linux 内核这种未受 AI 污染的高质量历史数据成为了稀缺资源。然而,当前的爬虫经济呈现出低效特征:爬虫运营者宁愿消耗巨大算力渲染 HTML,也不愿采用高效的 Git 协议,迫使开源项目消耗公共算力为商业 AI 训练买单。此外,攻击流量的载体已转向数以百万计的智能家电构成的住宅代理网络,反映出应用开发者通过植入 SDK 赚取“代理佣金”的灰色商业模式正在泛滥。技术防御手段虽能短期缓解,但长期来看,互联网“默认开放”的生态正在遭到破坏,未来获取高质量训练数据或将面临更严格的准入门槛。

核心观点:AI 对纯真人数据的饥渴导致开源资源被掠夺性抓取,正迫使互联网基础设施从“默认开放”走向“设防生存”的防御模式。

赞助推荐 一人公司 · 创业装备库
赞助推荐 一人公司 · 创业装备库

原文链接:Hacker News

赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » Linux内核官网遭AI爬虫狂轰滥炸,两成CPU算力被无端消耗
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型