#人工智能[超话]# AI数据中心现在遇到的瓶颈,已经不只是GPU够不够,而是一个越来越现实的问题:电到底从哪里来,而且能不能稳定地来。
为了绕开电网接入动辄数年的等待周期,越来越多Hyperscaler开始自己建“表后电源”甚至离网电源系统,用天然气轮机、内燃机等方式直接给数据中心供电。现在美国已经有4个投入运行的离网或半离网AI数据中心,包括xAI的Colossus和Colossus II、Crusoe的Stargate Abilene,以及Vantage VA 2。问题是,4个项目里已经有3个被曝出现技术故障。
这件事最值得关注的,不是某一台燃机坏了,而是AI负荷和传统发电设备之间可能存在天然的不匹配。
AI训练并不是平滑用电。大规模计算开始时,功率需求会突然冲高;计算阶段结束、进入结果汇总时,功率又会快速下降。随着数据中心越来越大,这种功率摆动可能达到数百MW,甚至GW级。对于传统燃机、发动机这样的旋转设备来说,这意味着持续承受极端的负荷变化,可能加速设备老化,甚至造成轴系断裂等严重故障。
更夸张的是,一些Hyperscaler要求供电系统在几十毫秒内响应,而传统行业习惯的响应时间是数百毫秒。也就是说,AI正在把过去主要属于“算力系统”的瞬时响应要求,直接传导到能源系统。
这其实揭示了AI基础设施的一个重要变化:
过去大家讨论数据中心能源,重点是有没有足够的电。
未来真正的约束可能变成:
有没有足够多、足够快、足够稳定,而且能够承受高频负荷波动的电。
这两者完全不是一回事。
而且停电的经济代价会非常高。Anthropic目前每月向xAI支付12.5亿美元,以获得Colossus和Colossus II的算力。按照这个规模粗略计算,如果整个系统停机一天,对相关方造成的经济影响就可能达到数千万美元。
所以Hyperscaler愿意为供电可靠性支付非常高的溢价,也就不难理解。
但这里面还有一个容易被忽视的投资风险:这些风险最终未必由Hyperscaler承担,而可能更多压在能源供应商身上。
一般情况下,电力供应商没有供电就收不到钱,部分合同还需要支付违约金,同时设备损坏后的维修和更换费用往往也是供应商承担。Solaris给xAI供电的合同就是如此:如果无法交付电力,需要退还费用,并承担设备维修或更换成本。
真正危险的情况甚至不是突然坏掉,而是设备寿命比原来预计的短。
如果原来模型里认为一台燃机能稳定运行十几年,最后发现AI这种高波动负荷环境下只能运行更短时间,那么整个项目的折旧、维护资本开支和IRR都会被重新计算。技术问题最终会变成资产负债表问题。
而现在这个实验正在快速放大。
Amazon计划在得州Pecos County建设一个AI数据中心园区,现场天然气发电容量可能高达7.65GW,相当于七八座核电站。
这已经不是“数据中心配几台备用发电机”,而是在数据中心旁边重新造一个大型电厂。
所以我觉得,AI电力这条投资主线未来可能需要从单纯的“缺电逻辑”再往前走一步。
真正受益的未必只是拥有燃机、天然气资源或者发电资产的公司,而可能是那些能够解决瞬态负荷、储能缓冲、电能质量、快速调节、微电网控制以及设备寿命管理的公司。
因为AI正在改变的不只是全球算力需求。
它甚至可能开始重新定义:什么才是一套合格的电力系统。
发布于 北京
