GitHub 通报 8 月 17 日大规模宕机事件原因:基础设施容量未能跟上平台使用量的快速增长

发布于

IT之家 8 月 21 日消息,GitHub 现已公布 [8 月 17 日平台大规模宕机事件](https://www.ithome.com/0/990/842.htm) 的调查结果,确认此次事故并非由程序代码或配置变更引起,而是“基础设施容量未能跟上平台使用量的快速增长”。本次大规模宕机合计造成 GitHub 网站、身份验证、GitHub Actions、API、Pull Request、Issues 等多项服务中断 7 小时 47 分钟。

GitHub 表示,当日平台流量创下历史新高后,导致美国中部数据中心的一项关键基础设施组件容量不足,进而令压力扩散至其他系统,导致身份验证失败以及多项服务异常。在恢复过程中,部分服务又因为错误触发客户端重试机制,进一步增加系统流量,因此最终技术人员花费了较长时间才完全恢复平台服务。

![img1](http://pic.zhso.org/2026/08/21/9dbd301b2bd9.png)
![img2](http://pic.zhso.org/2026/08/21/8f76a2c0057a.png)
![img3](http://pic.zhso.org/2026/08/21/2108c417b9ea.png)

IT之家注意到,这已经是 GitHub 本月发生的第二起重大服务事故。此前,GitHub Actions 已经在 8 月 6 日发生服务故障。GitHub 表示,两起事故的核心问题都是基础设施容量不足,而不是程序代码或配置变更导致的故障。

GitHub 近期平台使用量增长迅速。今年 4 月至今,每月提交(commit)次数已经从 14 亿次增加至 29 亿次,合并 Pull Request 以及新建代码仓库的数量也持续增长。

为了应对平台使用量持续增长,GitHub 今年已经增加超过 300 万个 CPU 核心、120PB 高速存储空间以及网络容量,并加快将工作负载迁移至微软 Azure。目前约 58% 的 GitHub 平台负载已经由 Azure 承载,远高于今年 5 月的 12%;此外,约一半的 Git 操作也已经由 Azure 负责处理。然而尽管微软进行了如此优化措施,还是遇到了“用户量挤垮平台服务”的情况。

GitHub 声称,接下来技术人员将进一步隔离平台关键系统,减少不同服务之间的共同依赖,同时统一设置服务间的重试次数上限和超时机制,避免系统出现异常时,大量客户端或服务自动重复请求进一步增加负载,最终形成连锁故障。

---

原文链接:[点击查看](https://www.ithome.com/0/992/844.htm)

评论

暂无评论。

0.056813s