![]()
微软云服务与Azure托管于美国西海岸的相关服务,于上周四因网络连接故障发生长达数小时的中断。尽管完全运行于微软美国西部云区域内部的服务未受波及,但所有进出该设施的流量均受到了影响。
微软随后发布了一份初步事故事后审查报告(PIR),记录显示此次连接中断发生于7月23日UTC时间14:44至19:41,持续时间约为五小时(太平洋时间上午7:44开始)。事故根源在于:工程师在对一台设备执行例行维护隔离操作时,误删了一组IP路由。
在启动维护工作之前,微软已确认通往该设施的两条冗余路径中至少有一条保持正常运行。然而,在实际执行过程中,自动化系统将部分额外设备纳入了隔离范围,进而删除了若干未包含在初始评估中的IP路由,最终引发此次故障。
客户很快察觉到异常,工程师在事故发生后的第一小时内便定位到了问题所在,并着手恢复服务连接。微软方面表示,此次中断与近期开展的"光纤维护作业"有关。
为降低此类操作失误在未来造成中断的风险,微软建议承担关键任务数据的企业考虑采用多区域部署策略。
此次Azure服务中断,是微软今年发生的第二起重大故障事件。今年2月,微软美国西部与美国东部区域曾出现长达10小时的服务中断。
Q&A
Q1:微软美国西部Azure服务中断的具体原因是什么?
A:此次中断是由于工程师在对设备执行例行维护隔离操作时,自动化系统将额外设备纳入隔离范围,误删了部分IP路由,导致进出美国西部云设施的网络连接全面中断,持续时间约五小时。
Q2:此次Azure中断影响范围有多大?
A:此次故障影响了所有进出微软美国西部云区域的外部流量,但完全运行于该区域内部的服务未受影响。中断时间为UTC时间7月23日14:44至19:41,历时约五小时。
Q3:微软建议企业如何避免类似故障带来的影响?
A:微软建议承担关键任务数据的企业采用多区域部署策略,即将业务分布在多个云区域,以确保当某一区域发生故障时,其他区域仍可正常提供服务,从而降低单点故障带来的整体影响。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.