| 分享: |
本文按时间顺序盘点2026年以来最具代表性的重大宕机事件。
事件时间线总览| 日期 | 运营商 | 区域/设施 | 根本原因 | 影响时长 |
|---|---|---|---|---|
| 1月 | Oracle Cloud | 美国东部 | 冬季风暴导致停电 | TikTok部分服务中断 |
| 2月7-8日 | 微软Azure | 美国西部 | 变压器故障+控制系统级联失效 | 约20小时 |
| 3月1-2日 | AWS | 中东区(UAE/巴林) | 导弹残骸击中设施引发火灾 | 约60项服务中断 |
| 3月2日 | Anthropic | 全球 | “前所未有的需求”致全线宕机 | 约一天 |
| 3月3-4日 | Oracle Cloud | 美国东部(阿什本) | 网络基础设施故障 | TikTok中断约10小时 |
| 4月24日 | 微软Azure | 美国东部 | 资源配置和扩展故障 | 约12小时 |
| 5月7-8日 | AWS | 美国东部(us-east-1) | 冷却系统热事件+电力中断 | 单可用区故障约28小时 |
| 5月29-30日 | 微软Azure | 美国西部2区 | 雷暴和闪电引发电力扰动 | 15-22小时降级运行 |
| 6月5日起 | STT GDC/塔塔通信 | 印度新德里 | 锂电池火灾 | 持续近3周仍未完全恢复 |
| 8月13日 | RadiusDC(凤凰城) | PHX-01设施 | 风暴致电力波动→冷水机组故障 | Liquid Web中断约37小时 |
一、Oracle Cloud 美国东部宕机
时间:1月
运营商:Oracle Cloud Infrastructure (OCI)
区域:美国东部
原因:冬季风暴导致数据中心停电。Oracle CEO拉里·埃里森曾在2022年声称其云服务“不会宕机”,此次事件使该言论再度受到质疑。
影响:TikTok美国服务部分中断,这是TikTok USDS合资企业接管美国运营后首次重大服务中断事件。
二、微软Azure 美国西部区域宕机
时间:2月7-8日
运营商:微软Azure
区域:美国西部(West US,加利福尼亚州)
2月7日
07:52 UTC — 数据中心变压器发生电气故障,UPS电池开始承载负载。
07:58 UTC — UPS电池耗尽(仅维持约6分钟),客户开始受到影响。
09:31 UTC — 备用发电机恢复约90%的IT机架供电。
11:29 UTC — 数据中心完全依靠发电机运行。
2月8日
03:42 UTC — 恢复市电供电。
04:24 UTC — 事件正式缓解
三、AWS 中东区数据中心遭物理打击
时间:3月1-2日
运营商:Amazon Web Services
区域:ME-CENTRAL-1(阿联酋)/ ME-SOUTH-1(巴林)
当天持续进行API层面的修复和流量调度。
IDC全球基础设施研究主管Ashish Nadkarni指出:“保护数据中心现在就像保护最高安全级别的政府办公室一样。”
四、Anthropic Claude 全球性宕机
时间:3月2日
运营商:Anthropic
原因:“前所未有的需求”(Unprecedented demand)。
影响:API、网页界面、Claude Code全线不可用,持续约一天。
那些围绕单一AI模型提供商构建工作流的企业发现,自己没有任何备用方案。这一事件与AWS中东宕机几乎同时发生,形成了对“单一供应商依赖”的双重警示。
五、Oracle Cloud 美国东部二次宕机
时间:3月3-4日
运营商:Oracle Cloud Infrastructure (OCI)
区域:美国东部(阿什本,Ashburn)
六、微软Azure 美国东部资源配置故障
时间:4月24日
运营商:微软Azure
区域:美国东部
原因:资源配置和扩展故障。
影响:约12小时(11:30-23:22 UTC),服务降级运行。
七、AWS us-east-1 冷却系统热事件
时间:5月7-8日
运营商:Amazon Web Services
区域:美国东部(us-east-1),可用区use1-az4(北弗吉尼亚,AWS最古老、最大、最繁忙的数据中心枢纽)。
5月7日
约17:25 PT — AWS工程师检测到可用区use1-az4的热问题,过热触发了电力中断,损坏了受影响机架上的服务器硬件。
20:25 ET — AWS发布首个状态更新(事发近3小时后)。
5月8日
确认全面恢复仍需数小时,“进度比预期慢”恢复耗时超过28小时。
AWS在声明中坦言:“我们正在积极努力增加冷却系统容量,这将使我们能够恢复受影响区域中剩余的受损硬件。”——这意味着现有冷却基础设施无法承受当前的热负载,而非单纯的设备故障。
| 设备类型 | 单机架功耗 |
|---|---|
| 十年前的标准计算机架 | 5-10 kW |
| 当今AI服务器机架 | 30-100 kW |
传统风冷无法在这些功率密度下快速散热。当环境温度超过ASHRAE推荐范围(18°C-27°C)时,服务器先降频,若仍无法控制则自动关机以防硬件损坏——这正是AWS遭遇的情况。
八、微软Azure 美国西部2区雷暴停电
时间:5月29-30日
运营商:微软Azure
区域:美国西部2区(West US 2,华盛顿州)
原因:强雷暴和闪电引发的电力扰动。
影响:15-22小时降级运行;Azure OpenAI服务另行中断约7小时。
九、印度新德里数据中心锂电池火灾
时间:6月5日起
运营商:ST Telemedia Global Data Centres (STT GDC) / 塔塔通信(Tata Communications)
设施:STT Delhi 2,位于新德里 Greater Kailash-1 地区 Next-Gen Tower,容量约1.1MW
6月5日
塔塔通信向证券交易所提交文件,披露火灾事件。
消防人员控制火势,无人员伤亡;德里消防部门称起火点疑似位于锂电池单元。
电视画面显示:服务器机架和电气基础设施被完全烧毁,天花板面板坍塌,碎片散落一地。
6月23日
谷歌表示团队已在安全许可后进入受损区域,持续恢复容量。
事件在Google Cloud状态页上持续显示为“进行中”,持续近3周。
塔塔通信子公司Novamesh在致客户的信中承认:“尽管我们持续尽最大努力恢复数据,但损坏的严重程度……对受影响数据和系统的恢复构成了重大挑战。”
塔塔后续表示,已订阅恢复和备份服务的客户服务已恢复,其余客户的恢复仍在进行中。这一对比揭示了一个残酷的事实:云基础设施的韧性仅取决于客户实际付费的备份层级。将容灾视为“打勾交差”而非关键投资的企业,正面临永久丢失数十年记录的风险。
十、美国凤凰城PHX-01冷水机组故障
时间:8月13日
运营商:RadiusDC(设施PHX-01,151,000平方英尺,10.5MW)
受影响托管客户:Namecheap、Liquid Web(含Nexcess品牌)、phoenixNAP、
03:28 — phoenixNAP发布“环境温度升高”通知,称“无关键服务受影响”。
05:53 — Liquid Web开通事件,仅提及“凤凰城数据中心网络问题”。
06:21 — phoenixNAP自有支持门户宕机,客户无法提交工单。
07:30 — RadiusDC在事发4小时后致信客户,称原因是“夜间风暴导致的多次电力波动引起的白空间温度升高”。
07:45 — 冷水机组D恢复运行。
07:51 — Liquid Web确认“重大冷水机组设备故障”(距phoenixNAP首发超4小时)。
09:19 — Liquid Web工程师开始“必要时优雅关闭受影响系统以保护客户数据”。
18:23 — phoenixNAP服务恢复。
8月14日
约19:00 — Liquid Web Cloud Sites平台恢复(距开事件约37小时)。
RadiusDC没有公开状态页面,其网站上对此事件没有任何公开信息。唯一详细的事故说明之所以公之于众,仅仅因为租户phoenixNAP在自己的状态页上全文转载了RadiusDC的客户信。
这暴露了数据中心行业供应链中的信息传递断层:客户与故障设备之间隔着多层公司——Namecheap找的是RadiusDC,而RadiusDC在事发4小时后才通知客户。
趋势分析与行业启示2026年上半年的重大宕机事件中,根因几乎全部是物理性的:变压器故障、冷却系统失效、锂电池火灾、极端天气,甚至军事打击。这标志着行业焦点正从软件可靠性转向物理工程可靠性。
AI服务器机架功耗达到传统机架的3-10倍,而老旧设施的设计热容量远不能匹配。AWS北弗吉尼亚冷却失效事件是最典型的案例——这不是一次性设备故障,而是热生成与热移除之间的容量错配。随着每一代GPU的部署,这一差距只会继续扩大。
三、单一供应商依赖的代价正在飙升
“如果你的智能体运行在一个模型、一个云、一个区域上——你没有智能体,你只有一个带心跳的责任。”—— Moltbook Observatory
AWS、Azure、Google Cloud在2026上半年各至少经历一次重大事件,没有任何单一超大规模云提供商拥有干净的记录。Forrester预测2026年将出现多日级别的重大云中断,因为超大规模云服务商将基础设施投资转向GPU和AI工作负载,导致传统环境更加脆弱。
凤凰城事件揭示了从客户到故障设备之间存在多层中间商,而设施运营商(RadiusDC)甚至没有公开状态页面。在供应链的每一层,信息传递都存在延迟和失真。
新德里火灾最直接的教训:韧性不是默认的,它是一项需要付费的服务层级。塔塔通信明确表示——已订阅恢复和备份服务的客户已经恢复,其余仍在等待。Matrix Cellular的20年数据能否恢复仍是未知数。
结 语2026年的宕机潮传递了一个明确信号:数字世界的脆弱性正在从代码层下沉到物理层。当AI驱动的算力增长速度远超支撑它的电力、冷却和容灾工程能力时,物理基础设施——而非软件——正在成为云可靠性的决定性瓶颈。
对于企业IT决策者而言,2026年的核心启示可以浓缩为一句:
多区域、多云、多模型架构不再是奢侈的架构决策,而是最低可行的韧性姿态。
那些为其系统规划了“供应商宕机之日”的企业将存活下来。问题不是“是否”会发生,而是“何时”。
来源:智算云未来
- End -
由CDCC、益企研究院、开放计算标准工作委员会(OCTC)、隆高展览(上海)有限公司主办的“第13届中国上海国际数据中心产业展览会”、“第8届中国数据中心绿色能源大会”、“第2届智算中心供配电大会及展览会”将于2027年6月3-5日在上海新国际博览中心召开。同期展会(点击文字查看详情)
第13届上海国际数据中心及智算中心供配电展览会
第16届上海国际长时储能及液流电池展览会
第26届上海国际动力设备及发电机组展览会
第27届上海国际新型电力装备及变压器展览会
同期会议
· 第8届中国数据中心绿色能源大会· 主旨论坛——液冷技术专场——800V直流供电技术专场——算电协同技术专场——华为数据中心能源专场· 第四届中国电器工业发展论坛——绿色输配电装备智能制造发展分论坛——电控配电绿色低碳高质量发展分论坛——数智时代下变压器制造技术分论坛——新能源送出关键设备及器件技术发展分论坛——高端铁心材料赋能十五五电力系统升级分论坛——非晶纳米晶合金产业发展分论坛——液流电池技术发展分论坛——燃料电池标准化与技术创新分论坛——多燃料内燃发电动力论坛联系我们
展会咨询



![]() |
![]() |
![]() |
![]() |
![]() |
世展网公众号 |
微信小程序 |
国内展客服 |
国外展客服 |
门票客服 |

