原定的Stargate UAE因为一发导弹,被迫将5GW的巨型园区改为分散各地的数据网
最近这两天,被路透社的一个消息给砸懵了。那个阿联酋5GW的AI数据中心项目因为伊朗的战火而悄悄改图纸。这可是5GW,除美国外最大的AI算力集群。
“先帝创业未半而中道崩殂”(os:应该可以这么说吧…)
这个项目大家应该略有耳闻“Stargate UAE”。各位大佬齐聚一堂,Nvidia、OpenAI、Oracle、软银投300亿美元规划建26平方公里的超级园区。这个项目分为两阶段,第一阶段是已经开工了,做1GW的集群,首批200MW预计今年投运;第二阶段也就是要被改的,剩下的4GW。
原先的规划是一个10平方英里的巨型园区建在阿布扎比郊区的达夫拉空军基地旁边,挺意内的选址。毕竟基地里住着美军,美系芯片、服务器搁里头,政治层面能过关。
现在因为安全问题,要把聚一起的巨大园区拆开分散到N个地点,重要敏感数据搬进山里,其他的分散开来,形成一个数据网。外加防空系统、地下设施还有抗爆混凝土,不知道的以为要建末日地下堡垒。
但拆开之后,训练还跑得动吗?这是我比较关心的问题。
要知道,AI大模型训练本质上就是把成千上万块GPU绑在一起做同一件事。每块GPU有自己负责的工作要做,“专人专项”但又互相交织,每走一步都要对一下进度。
这里关键的地方就在于“对进度”。
现在的训练集群的通讯分为三层。单台服务器里8块GPU用NVLink来互联,带宽每秒3.3TB。对一下,你家的千兆宽带差不多是它的三百万分之一。就照这个速度下去,8块卡融为一个整体,称之节点;接着把几十台服务器连接起来,走IB网络或者RoCE,带宽就会掉到每秒900GB ,也就是单台带宽的四分之一,勉强能用。但如果节点与节点之间的距离太远,像是跨市区、跨园区这种就只能走普通光纤,普通光纤更慢,每秒50GB。
而我们都知道模型训练对延迟极度敏感。
那阿联酋现在的意思就是第一阶段的1GW按老计划进行推进但是会加安全防护,后面的4GW,按现在讨论来看,大概率得分开,离多远现在还是未知数。要是还在同个城市,用专线互联还能控制一下延迟。但如果按防空安全的要求,一些在地下,一些进山里,那光纤拉过去的具体可就远了。训练这方面几乎是灾难,但训练只是一部分,推理、数据存储、冷备份这些对延迟没那么敏感,可以把这些工作分到4GW那儿。
但如果阿联酋想做自己的大模型训练,那分散方案无疑就是给自己挖坑。
效果是这样计算了,那加固防爆是不是很贵?
在我没有去了解的时候,我是觉得成本肯定得涨了。但了解后知道,腾讯的七星数据中心就是典型的把服务器塞进大山里的例子。占地776亩,总投资8.2亿元,预计容纳5万台服务器。山体厚度几十米到上百米,官方是说能扛住250米外15吨tNT的爆炸冲击,就冲这数字阿联酋得往山里钻。
算了算成本账,由于山洞里岩层常年15℃,地下百米深的岩温稳定在15到18℃,这温度能够节能36%,一年电费能省下4000万。再加上这是隧道工程全长648米,4个月就贯通了,时间成本也打下来了。
所以你看,一个真正扛打的数据中心用8.2亿就建起来了,再摊到5万台服务器上,单机柜成本没有想象中那么吓人。
案例说完,视角切到中东。专门做数据中心加固的Ramboll工程总监Naji Berbari,他有算过一笔账,加固一个完整的数据中心要用到抗爆混凝土、防爆门、法拉第笼、地下通风和冗余冷却等,建筑结构成本会涨大概20%,但把IT和运营成本全算进去,全生命周期成本只涨了4%。
因为地下和山体设施的寿命理论上是100年,但普通的地上机房只有50年。时间一长多花的钱平摊到里面,一下就稀释掉了。
所以加固这笔账算下来,短期看是多花钱,长期看反而更划算。再说了,现在就算成本再贵,对于中东来说,加固已成必选项。
这对中国设备上来说无疑是个好的信号。防爆门、防爆阀、抗爆混凝土、法拉第笼钢丝网、地下通风管道、冗余冷却、分布式备用电源、地质勘察与加固这都会是中东地区标书里新增的品类。
但说到这里就不得不笑一下了, 之前阿联酋为了拿到美系芯片承诺10年累计向美国的AI框架投资1.4万亿美元还同意切断与中国的AI合作。
但我粗略把整条产业链拆来看。
总之,这可能就告诉我们,AI基建的第一波在拼谁卡多、谁钱多,那第二波,拼的是谁能把算力放在安全的地方,还能让它跑得起来。
编辑 | 星云
审核 | 智枢
图源 | 网络
#AI #AI出海 #中东出海 #人工智能 #AI数据中心 #AI算力 #AI基建 #Stargate UAE #全球化 #出海合规

