GitHub周一即8月17日发生大范围服务故障,全球软件开发工作受到干扰。受影响范围包括代码托管平台网站、应用程序接口、拉取请求、自动化工具和人工智能服务。GitHub在收到性能异常报告后,于协调世界时13时40分建立事故记录,并表示工程师正在调查多个相互关联的服务。此次事件并非只影响某一种开发功能,而是同时波及浏览代码、协作审查和自动执行任务等核心环节。由于许多个人开发者、开源项目和企业工程团队把GitHub作为日常协作基础设施,故障很快产生跨地区影响。
GitHub官方状态页面显示,事故期间网页功能和应用程序接口流量的错误率约为百分之二十。代码仓库压缩档案和原始源代码内容下载的错误率接近百分之五十。GitHub和科技媒体BleepingComputer称,一些用户遇到服务器错误,或者无法稳定加载提交记录、代码仓库与拉取请求页面。不同用户所见影响并不完全相同,部分页面可以打开,另一些请求却失败。较高的下载错误率也意味着依赖远程获取源码或构建材料的流程可能无法按计划执行。
故障随后扩展到应用程序接口请求、Actions自动化服务、网页钩子、问题追踪、拉取请求、Pages托管服务和Git操作。GitHub还在协调世界时14时31分报告,其人工智能编程助手Copilot可用性下降。包括SAML和OIDC登录、SCIM账户配置以及Team Sync团队同步在内的身份验证与企业管理系统也受影响,个人开发者和企业团队的日常工作因此可能被阻断。身份验证问题尤其可能妨碍受企业访问规则保护的账户,而网页钩子故障会使外部系统无法及时收到代码变化通知。
GitHub在协调世界时16时36分表示,已找到出现问题的组件并采取纠正措施。系统显示出明显恢复迹象,但错误率仍略高于正常水平。公司在16时59分宣布多个服务的故障已经缓解,之后却又报告许多服务仍有残余影响。截至18时11分,零星身份验证失败依然存在,公司继续实施更多缓解措施并调查剩余问题。官方信息表明恢复过程并非一次性完成,而是在纠正主要问题后继续处理间歇性失败。公司没有把识别出的具体组件名称或技术细节公之于众。
此次故障的影响不只限于读取已存储的代码,因为GitHub Actions为大量软件项目提供自动构建、测试和部署支持。因此,即使开发者仍保存本地代码副本,错误或延迟也可能中断版本发布流程和持续集成作业。拉取请求和问题追踪受阻还会延迟代码审查、缺陷处理与团队决策,网页钩子异常则可能影响连接GitHub的其他工具。到最新状态更新为止,GitHub尚未公布根本原因,也没有经过核实的证据表明网络攻击或人工智能相关流量引发了这次故障,因此不能把未经证实的网络猜测当作事实。
GitHub表示将继续采取缓解措施并检查尚未消除的影响。事故记录建议开发者和组织在服务恢复期间关注官方状态页面,以判断各项功能何时恢复正常。详细原因、最终持续时间以及客户受影响的完整规模仍未公布,因此在最新的已核实更新发布时,这起事故仍处于开放状态。后续结论有待公司进一步说明,包括是否发布完整根本原因分析,以及为减少类似故障再次发生而采取哪些技术措施。在正式结案前,用户仍需依据官方状态更新安排依赖该平台的开发和发布工作。
评论