8月6日星期四的 " GitHub行动 " 事件的影响和持续时间的特殊性都是不可接受的。
在所有基特赫布地区,供应仍然是我们的首要任务。
然而,由于这一事件,我们没有履行对你们的承诺。
我们知道顾客多依赖行动 这样的长期停业 会对你的生产力 以及对我们的信任产生真正影响 我们继续对这一事件进行更深入的根源分析,因为在要求完成调查之前,我们想充分了解许多方面。
我们将在调查结束后更新公开摘要, 除了通过我们调查发现的立即修复项目外,我们还在加快我们在GitHub Actions中的建筑路线图,与我们目前围绕隔离、复原力和规模所作的努力保持一致。
值得注意的是,作为上述事件核心的GitHub Actions服务仍在我们的数据中心全面运行,这是造成我们所经历能力不足的一个因素。
虽然大部分行动都在阿祖尔进行, 但我们还没有将迁移发射服务列为优先, 遗憾的是,如公开摘要所概述,连带失败导致无法接受地拖延恢复。
正因为如此,我们正在加速把GitHub Actions移到Azure,在那里,我们将有更多的头室和能力来吸收尖峰。
上个月,在我们更广泛的努力中,我们分享了蓄意暂停和更有力的稳定控制如何改变了我们把生产流量转移到阿苏尔的方式。 7月,这些控制使我们能够以更大的信心恢复这项工作,同时继续减少吉特胡布的共同依赖。 7月的简短版本: GitHub 越来越不依赖共享的基础设施和单个数据中心位置, 赋予我们更多吸收增长的能力, 这个月,超过一半的单片读取流量在Azure Central US运行,认证数据开始离开我们最古老的共享数据库,专用服务从共享路径中清除出大量负荷.
GitHub现在可以满足独立Azure容量的更大份额的客户请求,减少对任何单一数据中心的依赖,同时保留性能. 7月28日, 从美国中部阿祖尔(Azure Central United States)开始, Azure的Git流量从6月的43%上升到了47%,所有储存库的29%现在在美国中部拥有了第二个复制品,当一个区域退化时,故障减少干扰。
同样重要的是,在5月事件之后引入的稳定验证程序现在是每一次大规模交通扩张的一部分,帮助我们提高能力而不会增加客户风险.
我们还减少了关键客户工作流程的共用故障点。
第一批认证表从我们最古老的共享数据库转移到专用基础设施,证明了剩余工作的迁移模式。
认证和权限检查现在对共享路径的压力要小得多:高峰时,专用用户服务每秒卸载超过一百万个查询,而80%的重大授权查询已经转移到了孤立的服务路径.
存储内容的流量现在完全来自美国中部的专用基础设施,已经服务于匿名流量的专用牵引请求服务,在我们逐渐推出所有流量时,与认证读取的单行本的比例达到了99.87%。
这些变化加在一起使得GitHub某地的压力或故障不太可能会影响无关的客户活动.
GitHub 现在可以承担更多工作量