2026 年 7 月 24 日,微软公布 Azure 美国西部区域服务故障的初步事故复盘。

故障发生于 7 月 23 日 14 时 44 分至 19 时 41 分(北京时间 7 月 23 日 22 时 44 分至 7 月 24 日 3 时 41 分),持续约 4 小时 57 分钟。
期间,客户可能遇到资源连接失败、访问延迟升高,或无法访问部署在 Azure 美国西部区域的微软云服务。影响主要集中于进入或离开该区域的网络流量,完全在区域内部传输的流量未受影响。
受影响服务包括 Azure Kubernetes Service、Azure Cosmos DB、Azure Databricks、Azure AI Search、Azure AI Speech、Azure API Management、Azure Monitor、Azure Virtual Desktop、Microsoft Graph、Microsoft Sentinel、Power BI Embedded、VPN Gateway 和 ExpressRoute 等。
故障源于一次例行网络设备维护,此次维护需要隔离特定网络路径。
按照正常流程,微软会将维护请求转换为系统可读取的请求,并检查两条冗余路径中至少有一条保持正常;维护开始前,这些请求还会经过安全检查,以确认操作不会造成服务影响。
但此次请求转换系统出现 Bug,错误地将额外设备标记为本次维护的一部分,导致一组 IP 路由从比预期更多的设备上被移除。
这些路由位于 Azure 美国西部数据中心与广域网之间,因此影响了进入或离开该区域的网络流量。
故障发生后,问题最初表现为 Azure 广域网出现大规模路由震荡。
微软随后排查流量异常、路由行为、丢包信号和近期变更,最终确认被移除的路由来自美国西部区域的一座数据中心,并将异常路由行为与近期维护操作关联起来。

微软于 17 时 45 分开始回滚维护变更。
18 时 26 分,网络完成恢复并恢复健康状态。
19 时 41 分,所有受影响服务全部恢复。
微软表示,将对安全检查、自动化维护请求变更流程等环节展开全面分析。待内部复盘完成后,微软将发布包含更多细节的最终事故报告,通常会在初步报告发布后的 14 天内公布。