昨天著名CDN服务商Cloudflare故障,导致了很多其他网站也跟着一起挂了,比如Udemy、Coinbase、Discord。
Cloudflare写了一份事件报告说明了原因:
他们最近在架构中加了一个路由层“spine”来提升系统的可靠性和可维护性,可以让他们在运行维护时不会中断客户流量。因此这一层出现问题都会导致严重的影响。
而这次故障就是在这一层出了问题,他们不小心错误设置了IP访问策略,导致了一部分IP无法被公网访问
当然他们很快找到原因并恢复了服务。
在文章中他们也列举了补救措施和后续计划,会分别从流程、架构、自动化三个方面来改进。
详见:http://t.cn/A6a2cdWv
总的来说这是一次非常好的故障处理学习范本:
1. 先回滚第一时间恢复故障
2. 定位原因
3. 事后总结,找出问题根源
4. 采取后续措施,避免问题再次发生
补充一条评论(图4):http://t.cn/A6a20eBk
发布于 美国
