ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

AIDC深度拆解:从IDC到AI工厂的算力基础设施演进

AIDC深度拆解:从IDC到AI工厂的算力基础设施演进 1. 算力形态正在发生一场“静默革命”IDC为什么不够用了过去十年里我给不少企业做过机房改造和上云咨询那时候聊IDC互联网数据中心大家关心的核心指标无非三样机柜数量、带宽质量和PUE电能利用效率。一个标准的IDC机柜功率大概在4到8千瓦放个几十台通用服务器跑跑网站、数据库、企业应用已经是相当体面的配置了。但这两年情况完全变了。如果你最近接触过GPU服务器尤其是那种8卡甚至更密集的AI训练节点你会发现一个让人头疼的现实一个标准IDC机柜连一台AI训练服务器的电都供不起。英伟达DGX H100单机功耗就超过10千瓦而GB200 NVL72这种新一代AI算力整机柜方案单柜功率直接飙到120到130千瓦以上。这相当于把一个传统机房几十个机柜的供电能力全部压缩到一米见方的空间里。传统IDC的电力系统、制冷系统、网络架构在这个量级面前基本全部失效。这不是一次简单的设备升级而是一次算力基础设施形态的重构。行业里给了这个新物种一个名字——AIDC人工智能数据中心。也有人把它叫作“AI工厂”这个提法我特别喜欢因为AIDC和传统IDC之间的差异本质上就是“仓库”和“工厂”的差异。传统IDC就像仓库把服务器放进去、供电、散热、保证网络连通就算完成任务而AIDC是一套完整的生产系统它的输入是电力、数据和模型算法输出是训练好的模型权重和推理结果它要解决的是一整套从芯片到能源到算法到运营的协同问题。这篇文章我想把AIDC这件事从头到尾做个深度拆解。从全球格局、中美路径差异到落地的技术细节比如电力连接器、液冷方案再到未来十年的演进方向尽量讲透。应该能覆盖三类人群的需求一是做数据中心投资或产业研究的需要理解这个赛道的逻辑二是做IDC机房建设、改造和运维的从业者想搞清楚技能体系和岗位需求的变化三是对AI基础设施感兴趣、想系统了解算力产业的技术从业者。下面开始正题。2. 从“机房思维”到“工厂思维”AIDC重构的三个底层维度2.1 功率密度指数级跃升带来的连锁反应先看一组我在实际调研中整理的对比数据这张表基本能够说明AIDC和传统IDC的本质差异维度传统IDC早期GPU机房AIDCAI工厂单机柜功率4-8 kW10-20 kW30-130 kW单项目规模1000-3000机柜数百机柜数万卡起步可扩展到10万卡以上选址核心要素网络、客户、成本电力网络电力散热算力调度能力主要成本结构折旧带宽运维设备电力GPU设备折旧电力散热建设周期12-18个月6-12个月设计即最大化建设周期以年计这个表里最核心的变量是功率密度。如果稍微懂一点电气知识你马上就能意识到功率密度跃升十到二十倍意味着什么供电系统从传统的“UPS机柜PDU”模式需要升级为“中压配电高压直流HVDC或集中式UPS定制化母线槽”模式。散热系统从风冷切换到液冷而且是板式液冷或浸没式液冷这不是选择题是必答题。单柜30千瓦以上风冷已经压不住。布线空间被极限压缩铜缆改成光纤信号完整性成为新的瓶颈。传统IDC领域精通电力和暖通的人很多但能把“GPU服务器的供电纹波要求”“冷板液冷的流量分配”“无损网络的架构设计”三者结合起来的团队几乎没有。这就是为什么AIDC被叫做“新物种”——它需要的能力模型和IDC时代完全不同。对于从业者来说更直接的变化是你过去引以为傲的“不关机运维”“链路冗余”经验在新的算力机房里要打一个问号。AIDC对可靠性的定义已经变了它追求的不是“永不宕机”而是“宕机能快速恢复、业务能快速迁移”因为在高密度算力集群里故障是常态关键是如何把故障的影响面控制在最小范围。2.2 从“卖机柜”到“卖算力”商业模式的底层翻转传统IDC的商业模型非常清晰建设机房把机柜租给客户按月收租金和带宽费。本质上是个“房东生意”客户自己带服务器IDC运营方不关心客户跑什么业务只关心出租率和回款周期。AIDC的商业模式则完全不同。现在国内主流的智算中心建设方比如地方政府、运营商或第三方IDC服务商采购GPU服务器建设好算力平台然后以“算力服务”的形式卖给客户。客户不再关心你用的是A100、H100还是国产卡只关心一条我提交的训练任务能不能在预期时间内跑完以及单位算力的价格是多少。这就带来几个很现实的变化客户结构变了从企业IT部门变成了算法团队和模型训练团队。你可能要面对一群不懂机房、只关心CUDA统一计算设备架构版本和分布式训练框架的客户。收入模型变了从“按柜收租”变成“按卡时计费”或“按算力资源池计费”。空置的算力是每天都在贬值的资产。运营逻辑变了机柜不能空转GPU卡也不能空转。同样是10万卡规模的智算中心调度做得好有效算力利用率能从50%提升到80%以上这中间的利润差距是巨大的。关于智算中心的商业模型后面我会专门展开。这里先点出底层逻辑IDC是资源出租AIDC是生产交付。前者看的是机柜利用率后者看的是算力利用率和模型产出效率。2.3 “AI工厂”的类比AIDC的三个生产子系统如果把AIDC比作一座工厂它需要三个完整子系统协同运作能源系统相当于工厂的“动力车间”。与传统工厂不同的是AI工厂对电力的需求极其刚性而且需要的是高质量、高稳定的电力。GPU芯片对电压波动非常敏感一个毫秒级的闪断可能让几千块GPU同时训练中断丢失数小时的计算进度这个损失往往数以百万计。算力系统相当于“生产线”——GPU服务器、高速互联网络、存储系统组成一条完整的流水线。这条流水线的效率取决于网络是否存在瓶颈比如GPU之间通信是否拥塞、存储能否跟上数据读取速度、调度系统能否把不同规模的任务合理分配到不同计算节点上。散热系统相当于“环境控制中心”。在功率密度几十倍提升之后散热已经从“辅助系统”升级为“核心系统”对于风冷无法解决的高功率场景液冷成为主流选择。更关键的是散热系统的能耗直接决定了AIDC的PUE而PUE直接决定了算力的综合成本和碳排放水平。理解了这三个子系统你就能明白为什么AIDC的建设难度比传统IDC高出一个量级——它不再是“把房子盖好、通上电”就行而是要把电力、算力、热力三大系统作为一个整体进行联合设计和优化。这也就是为什么AIDC的规划设计周期和投资强度都远高于IDC。3. 一座真正意义上的AIDC到底由哪些硬核系统组成这个章节是全文最“值钱”的部分我会把AIDC的核心系统逐一拆开讲。为了有画面感我们以一座万卡集群级别的智算中心为参照对象。3.1 供电系统从“够用就行”到“精益求精”AIDC的第一要务是电力。一个万卡级的GPU集群单算GPU本身的功耗就在5到10兆瓦左右以H100/H800级别的GPU为例加上网络设备、存储、制冷、照明等辅助系统总电力容量至少需要10到15兆瓦。如果是10万卡规模的超大规模集群电力需求直接进入100兆瓦级别。这个量级是什么概念一个普通的大型商场用电负荷只有几千千瓦一个AIDC相当于几十个大型商场的用电量。电力系统的核心技术点有三个中压配电架构110/10千伏降压进入园区后通过中压环网柜分配到各栋机房。与传统IDC相比AIDC要求10千伏母线具备更高的冗余度一般是2N配置两路独立电源互为备份部分核心节点甚至做到“2N1”这个冗余度直接决定了后续供电可靠性的基础。高压直流HVDC与UPS的选择传统IDC采用交流UPS不间断电源为主逆变效率在94%-96%左右AIDC开始大量采用240V或336V的高压直流方案因为GPU服务器的电源模块本身支持直流输入省掉了“直流→交流→直流”的多次转换损耗整体能效可以提升1到2个百分点。别小看这1-2个点对于一个每年电费几个亿的智算中心这意味着每年节省数百万元。电力连接器的部署这是很多人容易忽略却极为关键的环节。传统IDC里服务器和PDU之间的电源连接器就是最普通的工业插座但AIDC场景完全不同。120千瓦的机柜电流达到170安培以上按单相电压计算如果是高压直流可能更高普通的IEC C19连接器根本扛不住。现在主流方案是采用定制化的大电流连接器比如定制化工业连接器标准和重型连接器标准要求具备更高的载流能力、更好的防误插设计和更强的抗振动性能因为GPU服务器的风扇和液冷泵会产生持续振动连接器松动是隐蔽性很强的故障源。我在调研中见过一起真实的电力连接器故障一台GPU服务器因为电源连接器接触电阻过大长期在高温下运行最终连接器外壳碳化导致整柜断电。事后排查发现问题出在机房建设时使用了标准IDC级别的连接器根本承载不了高功率AI服务器的持续满载电流。这件事给我留下很深的印象——AIDC的电力系统绝不是“线粗一点”就能搞定的每个环节都需要重新校核。3.2 制冷系统液冷从“可研报告”到“标准配置”的落地路径在AIDC领域空气冷却技术正逐渐逼近其物理极限液冷技术正在从可研报告和试点项目快速走向规模商用。功率密度一旦超过30千瓦/柜风冷方案需要极大的风量和极低的送风温度才能勉强维持散热这会导致PUE电能使用效率飙升到1.4以上在电价和碳排放的双重压力下几乎不可持续。液冷方案目前主要有两条路线冷板式液冷是目前绝对的主流基本原理是GPU芯片上方安装冷板冷却液通常是纯水或丙二醇水溶液流经冷板带走芯片热量再通过CDU冷量分配单元把热量传递给室外冷却塔或干冷器。冷板液冷的PUE可以做到1.1以下而且对现有服务器硬件改动较小兼容性好。现在英伟达的GB200 NVL72整机柜方案出厂标配就是冷板液冷接口液冷已成为AI服务器的主流配置选择。浸没式液冷更彻底把服务器整机浸没在绝缘冷却液中散热效率更高PUE甚至可以做到1.05以内。但它对机房承重、液体管理、服务器硬件本身都有特殊要求维护和服务器更换都比较麻烦目前主要用于少数高功率密度的定制化场景。这里要专门提一个词——“智算中心液冷可研”。这已经成为一个专门的咨询品类因为液冷不是“把服务器泡水里”那么简单它牵扯到机柜改造、管路布局、冷却塔配置、CDU容量匹配、楼宇承重、泄漏监测等一系列问题。很多地方在规划智算中心的时候可研报告里最大的争议点就是液冷和风冷的比例——全液冷初期投资高后期收益好混合冷却灵活但PUE优化有限。根据我的了解目前业内比较务实的做法是“风液混合”过渡新建机房预留液冷管路和CDU位置首批机柜采用风冷高密度方案等液冷生态成熟后再逐步切换。3.3 网络系统Scale-up与Scale-out两套完全不同的游戏规则AIDC的网络规划和传统IDC完全不同。传统IDC的网络基本是三层架构——核心、汇聚、接入流量模型以南北向为主用户访问服务器带宽要求也相对有限。AIDC的网络则复杂得多Scale-up纵向扩展网络解决的是“单台训练任务使用多块GPU”时的通信问题。NVL72把72块GPU通过NVLink英伟达的高速GPU互联技术组织成一台超级GPU机柜内部的通信带宽可以达到恐怖的数量级。这对机柜背板、线缆、连接器的质量要求极高。NVL72机柜内部线缆数量超过5000根任何一根出问题都可能导致整机性能降级。Scale-out横向扩展网络解决的是“多台服务器协同训练一个大模型”时的通信问题目前主流是InfiniBand和RoCE基于以太网的RDMA技术路线之争。InfiniBand性能好、生态成熟但价格昂贵RoCE基于标准以太网性价比高但对网络调优能力要求很高。在运维层面这对从业者的要求是颠覆性的。传统IDC网络工程师熟悉的是交换机的VLAN、ACL配置而AIDC网络工程师需要理解的是无损网络无损以太网、PFC优先级流控、ECMP等价多路径等概念甚至要能够诊断“GPU之间通信为什么慢了一半”这种玄学问题。3.4 算力虚拟化与调度系统算力不“碎”就是最大的价值前面系统都是“硬件”最后一层关键是“软件”也就是算力如何被有效分配给用户。传统IDC的“软件”是虚拟化平台加云管平台而AIDC的软件栈复杂度高得多——多租户混部不同客户的训练任务在集群上同时部署、GPU虚拟化MIG或vGPU、任务排队和抢占策略、断点续训机制每一块都是可以展开写的主题。讲一个实操层面的心得算力调度做得好不好直接反映在一个指标上——集群利用率。很多智算中心刚上线时GPU利用率只有30%-40%不是因为客户少而是因为调度系统太弱大任务和小任务无法混部、GPU显存碎片化严重、没有健全的优先级抢占机制。后来引入专业的AI算力调度平台如k8sGPU调度插件或商业调度产品利用率提升到70%以上单位算力成本直接下降30%-40%。这给从业者的启示是AIDC不是一个“建完就完”的项目运营能力才是长期竞争力所在。4. 全球格局与中国路径两种路线同一个方向4.1 全球布局三大区域三种打法从全球视角看AIDC的布局已经呈现出非常明显的区域分化美国是“撒钱换速度”的打法。科技巨头在算力基础设施上的资本开支是千亿美金级别。它们的逻辑很坚决算力是AI竞赛的入场券宁可超前建设不能落后挨打。所以美国的AIDC建设走的是“超大规模园区”模式——直接在一个园区内建设数十万卡的算力集群配套天然气发电站或可再生能源电站有点“算力帝国”的意思。东南亚和中东是“后发抢位”的打法。新加坡、马来西亚、沙特、阿联酋等国家凭借土地和能源优势正在大力吸引全球算力投资。特别是中东石油美元正在向“算力美元”转型沙特规划的NEOM新城中算力中心是核心基础设施之一。这些地区的共同特点是土地便宜、电力相对充足、政策灵活适合建设服务全球的超大算力节点。欧洲则更加保守受制于碳排放法规和电力成本AIDC建设速度相对较慢更注重能效和绿色化。欧洲的算力中心往往以中小规模见长特别强调PUE的极致优化和废热回收利用比如把数据中心废热接入城市供暖系统。这种模式虽好但在AI算力需求爆发式增长的背景下显得有些步履蹒跚。4.2 中国路径的逻辑集约化、枢纽化与算力网络中国发展AIDC的路径与美国不同核心逻辑是“集约化枢纽化”。国家通过“东数西算”工程确立了八大算力枢纽节点布局了十个数据中心集群引导算力资源向能源丰富、气候适宜的地区集中。这一路径非常符合AIDC的属性因为AIDC最依赖的两样东西——电力和散热——恰恰是西部地区的优势。内蒙古、贵州、甘肃等地不仅有丰富的风能和太阳能资源年平均气温也低于东部地区天然适合建设大型算力集群。加上特高压输电和大规模绿电交易机制西部地区完全可以发展成一个“算力制造基地”。国内AIDC的建设主体也呈现出多元化的格局。三大运营商是基础网络和机房资源的主力目前正在大规模改造存量IDC并建设新的智算中心以阿里、腾讯、字节为代表的互联网云厂商更倾向于建设自用和云服务相结合的算力集群技术栈和运营能力领先第三方IDC服务商则在地方政府的智算中心项目中扮演重要角色。这一路径的优势在于可以集中力量办大事快速形成超大规模算力集群避免重复建设同时通过绿电交易和自然冷源利用降低算力的综合能耗成本。挑战在于算力资源远离经济发达地区的用户网络时延问题需要通过高速骨干网和算力网络调度来缓解此外东西部之间的算力协同和数据流通机制还在建设初期尚未完全成熟。4.3 全球竞合下的“算力溢价”与产业链重构无论中美还是其他地区AIDC的大规模建设正在推动整个产业链格局的重组。过去数据中心产业链的核心是“房地产电力设备”而现在的核心变成了“芯片服务器能源液冷网络”的组合每一个环节都出现了“供不应求”的局面。以电力设备为例传统的变压器、开关柜、UPS供应商短期内订单排到了两年之后因为全球的AIDC建设都在抢电力设备产能。液冷产业链更是从零开始爆发冷板、CDU、快接头、管路系统等细分领域都出现了大量的新玩家。可以说AIDC就是当前整个科技产业链的“总发动机”它拉动的投资体量和就业规模远超过去任何一个硬件品类。但对于从业者来说更值得关注的是产业链不同环节的“溢价能力”差异。芯片设计和制造环节壁垒高、溢价能力强服务器集成环节格局相对稳定利润空间有限而能源和散热环节因为标准化程度相对低、定制化需求高存在较大的价值挖掘空间。如果你正在考虑进入这个领域电力和液冷方向可能是比单纯做服务器集成更有潜力的赛道。5. 智算中心的“里子”功夫从规划设计到运营运维的实战要点这个章节的内容很多是我在实际项目中踩过坑之后总结出来的。前面讲了宏观格局这里拉回到地面讲点能直接用的干货。5.1 选址的三个“反直觉”经验关于AIDC选址很多人第一反应是“要靠近客户”“要靠近网络枢纽”这在传统IDC时代是对的但在AIDC时代不完全对。我有三个实际调研中总结的选址经验电力比网络更稀缺传统IDC选址看网络AIDC选址看电力。一个10万卡的智算中心需要的电力供应相当于一座小型城市。很多城市根本没有那么多富余的电力指标即使有老旧城区的变电站容量也远远不够。所以宁可选择在距离城市50公里、但电力供应充足且价格便宜的郊区建AIDC也不要挤在市中心——AI训练任务对网络时延的敏感度远低于在线交易系统但对电价的敏感度极高。气候条件直接决定PUE水平AIDC的散热系统效率与外界环境温度直接相关。同样的液冷方案在贵阳年均气温15℃和在上海年均气温17.6℃的PUE差异可能达到0.05-0.1。别小看这个差距一个100兆瓦的AIDCPUE每降低0.1每年的电费节省就在千万级别按0.5元/千瓦时保守估算100兆瓦年耗电8.76亿千瓦时PUE降低0.1对应减少约8760万千瓦时电电费节省约4380万元。余热利用的“长尾价值”可能超预期AIDC产生的热量是巨大的。芬兰等地已经开始把数据中心余热接入城市供暖管网国内一些智算中心也在探索余热用于温室种植或工业烘干。如果你想做一个“绿色AIDC”的标杆案例余热利用的设计需要考虑在前期后补的成本很高。5.2 机柜级运维的五个高频故障与处理清单在AIDC的日常运维中我总结了一些高频故障和对应的处理思路故障现象可能原因处理思路GPU卡温度突然升高冷板流量不足、冷却液温度异常、服务器风扇故障检查CDU流量分配和冷板进口温度查看该机柜的液冷支路是否有堵塞整柜跳闸电力连接器接触不良、PDU过载红外测温排查连接器发热点校核柜内实际功率是否超过PDU额定值分布式训练变慢网络丢包或拥塞、GPU通信不均用网络监控工具检查RoCE/IB网络的丢包率检查是否存在ECMP哈希不均服务器频繁重启供电电压不稳、内存报错检查供电质量通过BMC日志定位是硬件故障还是电源质量问题液冷管路泄漏报警快接头老化、振动导致松动定期巡检快接头和管路支架建立液冷系统定期压力测试机制这里要特别强调在AIDC运维中“预防”比“应急”重要得多。传统IDC的故障处理是“出了事再处理”AIDC的故障处理必须是“预测性维护”——通过传感器和数据监控提前发现异常指标并处理。比如GPU服务器的功耗数据、液冷系统的流量数据、连接器的温度数据这些都应该纳入统一的监控系统建立基线之后就能自动识别异常。5.3 IDC机房运维面试的新方向技能树正在被重塑“idc机房运维面试”成为热词说明这个岗位的需求在爆发但要求也在变化。我在和一些正在转型的运维工程师交流时发现很多人的知识储备还停留在传统IDC时代这在AIDC时代是远远不够的。新的AIDC运维岗位面试中出现了越来越多以前不会出现的问题GPU工作负载下的电力谐波和电压暂降如何监测冷板液冷系统的CDU冗余切换怎么保证业务不中断InfiniBand网络的子网管理器Subnet Manager故障如何切换SLURM工作负载调度器或K8s容器编排平台的GPU调度如何排查任务堆积问题多租户场景下不同训练任务的网络隔离怎么做从这些面试题你可以看出AIDC运维已经不是单纯的“机房看门人”角色它需要同时具备电力、暖通、网络、Linux系统、GPU硬件五方面的复合知识。对想转型的从业者来说这既是挑战也是机会——复合型人才的稀缺意味着更高的薪资溢价。我认识的一个做基础设施运维的朋友因为自学了液冷系统运维和GPU集群排障薪资在两年内翻了接近一倍。6. 算力市场的需求侧视角谁在买AIDC的服务他们想要什么前面讲的都是供给侧——怎么建设、怎么运维。这一章节换个角度从需求侧看看AIDC服务的真实买单方和使用体验。6.1 主力客户画像大模型公司、云厂商与行业客户当前AIDC服务的需求方大概有四大类大模型公司和AI创业公司是第一梯队。他们的需求特点是“大而急”动辄需要成千上万张GPU进行预训练而且希望在最短时间内用上。这类客户对算力的价格相对不敏感但对“拿到卡的时间”和“集群稳定性”极其敏感。对他们来说早一个月训练完模型可能就意味着产品先发上市的优势。云厂商是第二梯队。阿里云、腾讯云、火山引擎、华为云都在大量采购AIDC资源一部分自用训练自己的大模型一部分对外提供GPU云服务器MaaS或PaaS。云厂商对AIDC的要求是“弹性”和“多租户隔离”他们需要通过云平台把底层的GPU资源池化按需分配给成千上万个中小客户。高校和科研机构是第三梯队。他们的需求特点是“碎片化”单次训练任务可能只需要几十张卡但对稳定性和结果可复现性要求很高。科研客户对价格敏感但对国产芯片的适配和开源生态的兼容性有特殊需求。传统行业客户是第四梯队也是正在快速增长的一块。金融、医疗、制造、能源等行业正在把AI能力引入生产流程——智能制造的质量检测、医疗影像的辅助诊断、金融风控的实时决策——他们的需求是“行业私有化部署推理为主”对数据安全合规极其敏感是未来几年AIDC需求的重要增量来源。6.2 一个典型的智算中心“客户旅程”为了让你对需求侧有更直观的理解我画一个典型的客户使用智算中心服务的完整流程用文字描述不画图第一步是需求评估。客户提交算力需求比如需求多少张GPU卡、训练什么模型、预计时长智算中心运营方评估可行性和报价。第二步是资源开通。客户通过控制台申请资源调度系统在几分钟内完成资源分配从GPU资源池中划出虚拟集群。第三步是环境准备。客户上传代码、配置数据集、准备好训练环境容器镜像。这里最大的痛点是“环境兼容性”——国产GPU芯片对主流深度学习框架的兼容问题是客户频繁咨询的重点。第四步是训练执行。客户提交训练任务调度系统分配节点训练开始。期间运维团队需要监控GPU利用率、网络状态、故障情况。第五步是结果交付。训练完成客户领取模型权重和数据释放资源按实际使用的卡时数付费。这个流程看起来简单但每个环节都有大量细节可优化。比如太仓某智算中心通过“预置模型镜像环境预编译”的方式把客户从提交需求到开始训练的时间从3天压缩到4小时这个效率直接提升了客户满意度。6.3 算力价格趋势为什么说“算力过剩”是伪命题市场上经常有“算力过剩”的说法但我调研下来发现这个问题要分两面看。一方面是“结构性过剩”——很多智算中心建好了却租不出去因为算力集群和客户需求不匹配比如全是训练卡没有推理卡或者全是国产卡客户需要英伟达生态另一方面是“绝对性不足”——高端算力特别是适合大模型预训练的顶级GPU集群仍然供不应求。这里有一个关键概念叫“有效算力”不是你买了多少张卡而是有多少卡在稳定地跑有价值的任务。很多智算中心的实际有效算力只有50%-60%剩下的时间花在了任务排队、故障恢复、环境调试上。所以行业里真正稀缺的是“高品质算力”而不是“低品质算力”。对客户来说选择智算中心有两个核心指标要充分评估一是“可用性”训练任务多长时间能跑通二是“卡时单价”单位算力成本。这两者往往存在矛盾——便宜的算力如果频繁故障、任务反复中断综合成本反而更高。我见过一个客户因为贪图便宜选择了某家不靠谱的智算中心模型训练连续三周没有一次任务能跑超过24小时不中断最终损失的时间和人力成本远超省下的算力费用。7. AIDC投资建设中的“交付陷阱”与避坑指南这一章节专门写给正在主导AIDC项目投资和建设的朋友。AIDC项目的投资体量动辄几十亿、上百亿一个决策失误可能造成几千万甚至几个亿的损失。以下是我在调研中看到的真实案例和经验教训。7.1 五个“看似合理实则致命”的决策误区第一个误区是“GPU选型只算初期采购成本”。很多智算中心在立项时把英伟达的H800/H100和国产芯片的价格做对比发现国产芯片便宜很多于是大量采购。但后续运营时发现国产芯片在生态适配、框架支持、分布式训练稳定性上还有明显差距导致很多客户的模型无法直接迁移GPU利用率长期在低位徘徊。我的建议是在选型阶段就要做“全生命周期成本”测算包括硬件采购、软件开发适配、闲置率、升级换代周期四个因素。第二个误区是“机柜设计功率预留不足”。我看到不止一个智算中心建设时为了省钱把机柜最高功率设计在30-50千瓦觉得“现阶段够用了”。结果新一代AI服务器一到根本放不进去只能大规模改造成本翻了不止一倍。正确的做法是机柜功率设计一步到位按照最高功率需求设计预留未来3-5年的升级空间。第三个误区是“电力容量只算IT负荷不算辅助系统”。AIDC的辅助系统制冷、供配电损耗、照明、安防功耗相当可观液冷方案虽然PUE低但CDU、冷却塔的功耗也不小。很多项目在初步设计时没有把这些负荷算进去导致规划的供电容量根本不够用只能重新申请增容工期严重拖延。第四个误区是“重硬件、轻软件”。很多智算中心建设时把90%的预算花在GPU和机房设施上留给算力调度平台、监控系统、AI开发平台的钱少得可怜。结果建完之后发现没有好用的调度和管理软件庞大算力根本玩不转。其实软件平台在整个项目中的投资占比应该在10%-15%这是保障算力被有效利用的关键。第五个误区是“重建设、轻运营”。一些地方智算中心建成之后没有专业的运营团队服务器空转资源闲置最终成为“昂贵的摆设”。智算中心成功的关键不在于“建好”而在于“运营好”——有没有稳定的客户渠道、有没有专业的运营团队、有没有灵活的商业定价模式这些在立项之初就要想清楚。7.2 智算中心项目的“三个阶段十条基线”基于多个项目的经验我整理了智算中心建设全流程的三阶段参照基线规划设计阶段0-6个月基线1完成电力供给方案可行性评估拿到电网公司的正式供电批复这是项目能否落地的前提。基线2确定液冷/风冷的技术路线和比例形成详细的散热系统设计方案。基线3完成GPU选型和算力规模测算明确首期投产规模和未来扩容路径。基线4确定客户定位和募资方案自用型、运营型还是混合型对应的设计理念完全不同。建设实施阶段6-18个月基线5土建、机电、机房同步设计施工AIDC项目周期紧线性推进来不及。基线6设备采购与机房建设并行GPU服务器下单后交付周期长达数月甚至半年以上。基线7建成后进行全链路联调和压力测试模拟真实训练负载测试供电、散热、网络三大系统。运营交付阶段第18个月起基线8上线算力调度平台建立多租户管理体系开放API接口供客户接入。基线9组建复合型运维团队电力、暖通、网络、GPU硬件四个岗位。基线10建立商业化运营机制包括定价模型、客户分级、服务水平协议和服务保障策略。7.3 算力利用率运营效率的核心KPI最后重点谈一下算力利用率。这是衡量一个智算中心是否成功的最核心指标但很多人对它的理解存在偏差。算力利用率不等于“GPU是否通电在跑”而是“GPU是否在跑有价值的计算任务”。比如一张GPU卡挂着闲置的Jupyter交互式编程环境界面看起来很忙但实际算力利用率为零。只有当我们运行真正的深度学习训练任务让计算核心、显存、数据带宽都饱和运转时才算被真正利用起来。提升算力利用率有三个抓手一是调度系统层面需要支持大小任务混部、GPU显存分片等策略这需要良好的任务调度机制二是业务层面需要引导客户合理使用资源比如训练任务结束及时释放资源对长时间空闲的资源进行回收三是运维层面通过监控平台持续分析资源使用情况找出“告而不用的僵尸资源”。一个参考数据国内智算中心的平均算力利用率在50%-60%之间优秀的可以做到75%-85%这中间的差异决定了同一个智算中心是盈利还是亏损。对运营团队来说算力利用率就是悬挂在头顶的达摩克利斯之剑——这是我在多个项目复盘后最深刻的体会。8. 液冷产业现状与智算中心能耗的“物理账”液冷是AIDC绕不开的话题也是目前产业链里最热的细分方向之一。我单独开一个章节把液冷的技术路线和能耗的“物理账”讲清楚。8.1 三种液冷路线怎么选目前主流的液冷方案有三种冷板式液冷、浸没式液冷、喷淋式液冷。它们的对比如下技术路线散热效率PUE水平技术成熟度改造成本适用场景冷板式液冷高1.05-1.15高中主流AI服务器、新建及改扩建机房浸没式液冷极高1.02-1.08中高超高功率密度场景喷淋式液冷中1.15-1.25低低存量风冷机房改造过渡冷板液冷能成为主流性价比和兼容性是关键因素。它不改动服务器内部结构只在芯片上方加装冷板对现有服务器生态的冲击最小。相比之下浸没式液冷虽然散热效率极致但服务器必须定制化设计无法使用标准产品这大幅限制了它的普适性。8.2 液冷系统的五个关键设计参数在液冷方案设计阶段有几个关键参数需要重点关注这里给出经验参考值冷板入口水温当前主流设计在35-40℃每提升5℃可显著增加自然冷却时长提升系统全年能效。CDU冷量分配单元冗余配置建议N1配置即一台工作、一台备用CDU需要具备故障自动切换能力避免单点故障导致整个机柜群过热。冷却液流量分配同一排机柜的流量分配应尽量均匀避免“近端冷、远端热”的问题这需要在管路设计时做水力平衡计算。泄漏监测在每个机柜底部和管路接口处安装漏液传感器一旦检测到液体泄漏自动关闭对应支路的电磁阀并报警。管路材质推荐使用不锈钢管路避免使用镀锌钢管容易锈蚀污染冷却液管路接口优先采用焊接或法兰连接减少密封失效风险。8.3 IDC改液冷试水路径与注意点存量IDC改液冷是很多老机房面临的实际问题。如果要尝试建议按“评估-试点-分批改造”的路径走。第一步先做存量机房热环境评估。用红外热像仪扫描现有高密度机柜的发热分布确定哪些区域适合改造液冷哪些保持风冷更经济。第二步选择一小排机柜8-12个作为试点部署液冷系统实测改造后的PUE变化、GPU运行温度和故障率。第三步根据试点数据决定是否大规模推广。如果试点效果不理想可以考虑只对高功耗机柜做液冷改造其余维持风冷形成风液混合方案。这个路径的风险最低。我调研过一家IDC服务商就是从试点8个机柜起步用了6个月时间完成验证再花12个月分批把全部高密度区域改造成液冷整个过程没有中断过任何客户的业务。9. 未来十年AI工厂的终局形态与三个关键变量9.1 从“单体智算中心”到“算力网络”未来十年AIDC不会以独立的“孤岛”形态存在而会逐渐连成一张覆盖全国乃至全球的“算力网络”。“东数西算”工程已经在为这张网络铺设基础设施而算力调度平台会像电网调度一样根据各节点的算力负载、电价、碳排放、网络时延实时优化任务的分配策略。这意味着超大规模算力集群将承担密集型训练任务的核心角色分布在客户附近的边缘算力节点则更多负责推理和实时响应。未来一个制造企业的AI质检系统可能训练任务在西部的大型智算中心完成推理任务在工厂附近的边缘节点完成中间通过高速网络实现无缝协同。这种“大模型训练小模型推理”的分层算力体系将是未来算力供给的主要形态。9.2 变量一绿色算力将从“加分项”变成“入场券”欧盟已经对数据中心碳排放提出了明确的限制要求国内也越来越多地把绿电使用比例纳入智算中心的审批条件。据我了解目前多个地区对新批复的智算中心项目都要求绿电占比达到一定比例否则不予批准。这意味着未来AIDC建设必须优先考虑可再生能源的配套供给要么在风能和太阳能资源丰富的地区选址要么通过绿电交易市场购买绿色电力。绿电不仅带来环保价值也带来直接的经济价值。在绿电价格下降和碳排放交易市场成熟的背景下一个绿电占比高的智算中心电力成本可能比传统火电驱动的智算中心低20%-30%。未来十年“算力成本能源成本”的公式会越来越明显。9.3 变量二芯片生态将决定算力的“天花板”AIDC的算力上限最终取决于芯片的性能和供给。过去几年高端GPU的供应紧张是世界性难题算力成为稀缺的战略资源。未来这一局面会逐渐改变但完全的封锁与反封锁博弈仍将持续。对于国内智算中心来说正在经历从依赖单一供应商向多生态并行的转型。国产AI芯片在训练效率和易用性上与英伟达仍有差距但国产芯片的迭代速度快生态适配持续推进。未来中国智算中心可能会形成“英伟达生态国产芯片生态KPU/ASIC专用芯片”共存的格局每种芯片在各自擅长的场景中发挥优势。从投资角度来看在GPU供给不确定性依然存在的背景下智算中心的建设应该具备一定的弹性——硬件基础设施支持不同品牌GPU的混插调度软件支持异构算力这样无论芯片供应格局怎么变化都能灵活应对。9.4 变量三AI工厂的“组织力”是最终胜负手最后想聊一个常常被忽视但决定成败的变量组织能力。AIDC不是简单的“买卡建房”它需要从投资、建设、运营到商业化的全链条组织能力。一个成功的智算中心背后需要一个懂技术、懂产业、懂资本、懂运营的复合型团队。而这个团队的培养周期至少需要两到三年比建一座楼的时间还要长。未来的竞争表面上是算力规模和能耗效率的竞争本质上是一个城市、一个区域或一个企业能否组织起一套完整的AI基础设施运营体系。建成一座智算中心只是一张入场券真正拉开差距的是谁能用这个平台持续产出价值。在我看过的项目里做得好的智算中心往往不是因为初始投资最多或GPU卡最多而是因为它们的运营团队能够快速响应客户需求能帮客户解决从模型部署到性能调优的实际问题能保持极高的GPU利用率。这种“软实力”才是AIDC时代最稀缺也最难以复制的东西。很多人在讨论AIDC的时候喜欢聚焦在芯片算力、单机柜功率这些硬指标上但在我跑了一圈调研之后最大的感触反而是硬件的差距可以通过采购来弥补而运营能力、生态建设、组织效率的差距才是真正决定一个算力节点未来十年能走多远的底层因素。如果你正准备进入这个领域我的建议很简单不要只盯着买多少卡、建多大的机房多花点时间想想“建成之后谁会用、怎么用、怎么长期用”。想清楚这个问题你的AIDC项目就已经赢了一半。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进