
AI大模型的规模化落地正在重塑算力基础设施的底层逻辑。从ChatGPT到DeepSeek,从文本交互到视频生成,大模型正从单模态向多模态快速演进,AI算力需求以远超摩尔定律的速度增长。当单机柜功率从传统数据中心的3-10kW飙升至100kW以上,风冷方案在12kW/柜的临界点前已力不从心,液冷技术不再是「更优选择」,而是智算中心建设的必要条件。
AI大模型的爆发式增长正在从根本上改变算力基础设施的技术要求。大模型从文本交互到视频生成、从单模态向多模态的演进,驱动着AI算力需求每三至四个月翻一番。国务院审议通过《关于深入实施「人工智能+」行动的意见》,明确提出推进人工智能规模化商业化应用,国家发改委同步推进国家人工智能应用中试基地建设。政策与需求双轮驱动下,智算中心建设全面提速,广义智算中心已从单纯的算力物理载体演进为「算力+数据+算法」融合服务的重要引擎。
传统数据中心的制冷方案正面临前所未有的挑战。GPU芯片TDP已从300W攀升至700W甚至更高,英伟达Rubin架构单机柜功率突破100kW,全面采用液冷且无风扇设计。一个关键趋势在于,当芯片功耗超过300W时风冷已难以有效散热,而AI服务器的GPU/NPU芯片功耗正从400W向700W甚至1000W迈进。
同时PUE管控持续加码,工信部要求新建大型数据中心PUE低于1.3,发改委要求东部枢纽低于1.25、西部低于1.2,绿色节能示范项目要求1.15以下。从行业实践看,12kW/柜以下风冷方案更经济,12-15kW是风冷液冷过渡区,超过15kW液冷方案综合成本更优。当AI服务器单机柜功率密度达50-100kW时,液冷已非选择题,而是必答题。
冷板式液冷是当下应用最广泛、产业链最成熟的液冷方案,其核心逻辑是通过冷板(Cold Plate)直接贴合CPU、GPU等发热芯片,利用液体的高导热特性带走热量。同体积液体的散热能力是空气的3000倍,导热能力是空气的25倍,同等散热水平下系统噪音比风冷降低10-15dB,节电约30%。
从系统架构来看,冷板式液冷分为一次侧和二次侧。一次侧包括冷水机组、冷却塔等室外设备,二次侧则由CDU(冷却分配装置,相当于系统的「心脏」)、Manifold(分歧管,相当于系统的「血管」)、冷板(相当于系统的「皮肤」)和快接头等核心部件组成。CDU负责将一次侧的冷量精准分配给各机柜,快接头实现了液冷系统的热插拔和在线维护。冷板式液冷目前约可带走IT设备60%-80%的芯片发热量,剩余20%-40%仍需通过风冷形式辅助散热。
在冷却液选择上,行业以25%乙二醇溶液和25%丙二醇溶液为主流。华为、曙光倾向乙二醇方案,浪潮、新华三则倾向丙二醇方案。去离子水虽然导热系数和比热容最优,但需要添加缓蚀剂和杀菌剂,且混合杂质后会导电,对系统维护要求极高。浸没式液冷则将IT设备完全浸入绝缘冷却液中,散热效率最高,PUE可低至1.05,单柜密度可达200kW以上,分单相浸没和相变浸没两种路径。喷淋式液冷通过喷头将冷却液直接喷洒到发热元件表面,当前应用最少。从产业格局看,冷板式凭借结构颠覆性低、标准化程度高、初始投资适中的综合优势,占据90%以上的市场份额。
液冷技术的规模化拐点正在来临,核心驱动力来自三个层面。
在芯片层面,英伟达2026年CES上亮相的Rubin架构已实现100%全液冷设计,底盘内部彻底取消了风扇,全面采用不锈钢波纹管替代传统EPDM橡胶软管,大冷板模组方案覆盖1颗CPU加2颗GPU的组合,交换机ASIC芯片和光模块也全部纳入液冷覆盖。
在整机层面,所有主流服务器厂商均已推出液冷产品和方案,经过多年迭代产品成熟度大幅提升,从通用节点到AI节点的液冷全覆盖已成现实。
在商业闭环层面,冷板式方案通过2-3年电费节省即可实现投资回收,PUE可降至1.15-1.2,显著低于风冷的1.4。
从市场数据看,IDC数据显示2024年中国液冷服务器市场规模达23.7亿美元,出货量超23万台,2025年有望突破900亿元人民币,2024-2029年年复合增长率达46.8%。应用场景正从互联网、电信向金融、制造、新能源快速延伸,储能和新能源汽车等领域的热管理需求进一步打开了增长天花板。液冷服务器市场中,浪潮、超聚变、宁畅、新华三等传统服务器厂商凭借技术积累、全栈服务能力和产业生态协同的综合优势维持较高份额。
互联网大厂是液冷落地的先头部队,占据智算需求市场的半壁江山。以阿里、字节跳动为代表的企业已大规模规划液冷智算中心,字节下一代AI训练集群单机柜功率规划达100-240kW,需部署64-256张GPU。围绕字节跳动的液冷需求,已形成涵盖核心模组、浸没技术、IDC集成、服务器供应等多维度的供应链体系,各供应商技术特色鲜明且形成互补生态。运营商为迎合智算需求也在对原有机房进行液冷改造。
海外市场的规模化落地进一步验证了液冷在万卡级集群上的可行性。马斯克的xAI项目与超微合作完成了10万卡H100 GPU的液冷集群建设,Grok 3.0基于该集群训练,实测算力利用率提升22%,故障率下降60%。Google、微软、OpenAI等同样落地了液冷智算中心,从可用性和可靠性层面扫清了国内玩家的顾虑。在国内,以超云为代表的整机柜液冷方案已实现单柜功率密度30-120kW,PUE低至1.2以下,兼容19英寸和21英寸标准机柜,覆盖通用计算和AI计算场景,整机柜液冷覆盖率达80%以上,采用模块化设计可实现工厂预制、快速部署。
液冷技术正在从数据中心的「可选升级」演变为智算时代不可回避的基础设施革命。它以更低的PUE、更高的单柜密度、更优的芯片运行环境和更低的TCO,为AI算力规模化部署提供了从物理层到系统层的完整支撑。当GPU性能的持续翻倍需要制冷效率同步跃迁,液冷就不再是「加分项」,而是算力基础设施的代际升级,这是一种从空气到液体的冷却范式重构,也是「双碳」目标下数据中心走向绿色高效的核心抓手。
分享一套解决方案:《智算中心液冷解决方案》值得参考借鉴~










































报名登记


麦麦网-往期好文推荐