根据一份可追溯的公开资料,Linux 内核代码托管站点 git.kernel.org 目前面临巨大的网络流量压力。该网站每天约收到 600 万次随机提交页面访问请求。
这一高并发的访问量引发了维护方的关注,因为据报告称,合法用户请求仅占 git.kernel.org 总流量的极小部分,而其余绝大部分(约 98%)被怀疑来源于抓取程序。这表明网站的正常使用与异常爬虫行为之间存在显著的比例差异。
从技术基础设施的角度看,Kernel.org 的运行依赖于其全球分布的五个分布式节点,这些节点共同配置了 90 个 CPU 核心来支撑日常运营和处理请求。
在流量构成方面,维护方基于现有数据进行了估算。报告指出,爬虫相关的渲染工作量约占总计算能力的 20%。同时,该站点本身也承载着重要的代码资产,例如 Linux 主仓库 linux.git 目前大约拥有 148 万次提交记录,并且 git.kernel.org 还托管了约 922 个分叉仓库。
面对持续的爬虫流量冲击,Kernel.org 采取了技术应对措施。维护方随后部署了名为 Anubis 的系统,该系统要求所有访问者必须完成一个基于 SHA-256 的工作量证明才能继续访问。
Anubis 工作量证明机制的初步效果是显著的。根据资料显示,Anubis 可以立即拦截大约 66% 的相关请求。然而,即使部署了此项防御措施,仍有约 33% 的请求能够完成计算并最终抵达主站,这提示了爬虫行为的复杂性和持续性。
从时间线和影响分析来看,此次事件揭示了一个背景问题:核心开源项目在极高的全球关注度下,其基础设施很容易成为自动化数据抓取的目标。维护方需要不断调整防御机制来平衡对合法开发者的服务需求与抵御恶意爬虫的必要性。
读者提示方面需要注意,资料中提及的“疑似”和“估算”等词汇,明确了当前信息来源的性质。因此,虽然流量数据和部署 Anubis 的行动是已确认的信息点,但关于 98% 占比的具体认定,仍需将其视为维护方基于初步分析得出的判断。
综上所述,Kernel.org 持续处理着巨大的访问量,并采取了工作量证明等技术手段来应对绝大部分被怀疑的爬虫流量。此次事件凸显了大型开源代码托管平台在网络安全和资源分配上面临的挑战。
信息来源
本文基于上述公开资料整理,未使用来源页面的图片、视频或嵌入媒体。