从 CDU 到 TMU:华为液冷技术再进阶,算力协同重构数据中心热管理格局
搜索

从 CDU 到 TMU:华为液冷技术再进阶,算力协同重构数据中心热管理格局

9月,华为在 ODX 开放数据中心大会正式发布《AI 使能液冷 TMU 技术报告》,首次系统阐释 TMU(热管理单元)的技术架构与核心能力;紧随其后,在华为全联接大会期间的 AIDC 基础设施峰会上,华为进一步明确液冷产业的演进方向 —— 从传统 CDU(冷却液分配单元)向 TMU 升级,并重点披露了微小漏液检测、工质健康预测、预测性维护三大核心能力,以及与昇腾算力原生适配、冷电联动的系统级特性。

这一系列动作的背后,是液冷设备的管理边界正在发生本质变化:从传统的换热控制与冷却液输配,延伸至冷却液全生命周期健康、故障前置风险识别,乃至与算力负载的深度协同。理解这一变化,才能真正读懂华为此次推广 TMU 的产业意义。


一、推广内核:强化液冷与算力绑定,从被动控温转向负载预判

华为 TMU 并非全新概念,2025 年其就已公开相关技术,供电冗余、换热能力与基础智能管理均有成熟的产品积淀。而 2026 年 9 月的密集推广,核心是将 TMU 全面融入源网荷储一体化的 AIDC 架构,突出与昇腾算力栈的原生适配,实现冷却系统跟随算力负载的动态快速响应。

这一升级的核心价值,在于改变了液冷系统的控制逻辑。传统液冷控制以温度、流量、压力等液路参数为依据,本质是 “热了再调” 的被动跟随模式。但在 AI 算力场景下,大模型训练、批量推理等业务会导致服务器功耗在短时间内大幅波动,被动控温容易出现芯片结温骤升、冷量供给滞后,进而引发算力降频、业务稳定性下降。

引入服务器负载端数据后,冷却系统可以提前感知热负荷变化趋势,预先调整供液流量与冷量分配,实现 “算力未动、冷量先行”。华为在峰会上提出的 “从算力出发开展联合设计、联合仿真和联合验证”,正是基于这一逻辑 —— 打破服务器与液冷设备之间的数据壁垒,需要两侧从产品研发阶段就深度协同。而华为同时布局昇腾算力与能源基础设施的全栈能力,为 TMU 落地这种跨系统优化提供了天然的产品基础。

二、功能对比:换热能力为共同基础,管理边界是核心差异

CDU 与 TMU 并非替代与被替代的关系,而是液冷设备在不同发展阶段的产品形态。对于液 - 液换热架构的系统而言,两者都需要通过板式换热器完成服务器侧与设施侧的热量传递,依靠水泵驱动二次侧冷却液循环,基础换热与供液的核心职能是一致的。

微信图片_2026-10-08_131552_913.png

传统 CDU 本身也具备完整的控制能力:可调节泵速、阀位,稳定供回水温度与压差,支持故障告警与集群控制。而华为 TMU 的定位,是在这些基础能力之上,强化风险前置识别、冷却液全生命周期健康管理与算力级协同。两者的对比核心,在于监测对象、控制依据与联动范围的延伸,而非简单的 “智能与否” 之分。

冷却液健康管理是最典型的升级方向。温度、流量等水力参数正常,不代表冷却液本身的品质始终合格。冷却液长期运行中会出现劣化,导致电导率升高、pH 值偏移,进而腐蚀管路、堵塞冷板微通道。华为在 2025 版《AIDC 基础设施参考设计白皮书》中就已提出,通过电导率、pH 值等参数的实时在线监测,预测冷却液劣化趋势并开展主动维护,将管理对象从液路运行状态,进一步延伸到冷却液本身的品质状态。

微小漏液检测则将运维响应节点大幅前置。液冷系统中冷板、快接接头、管路连接点数量众多,是泄漏高发区。传统漏液检测多为接触式,需泄漏液体积累到一定量才能触发告警,往往已经造成局部影响。微小漏液检测可识别更早期的小规模泄漏,为故障排查与维护争取充足时间。它与工质健康预测共同指向一个明确的运维变革:从参数越限后的事后告警处置,逐步转向异常趋势的提前识别与干预。

三、能力底座:稳定可靠的供液能力,是管理升级的根基

管理范围的扩大,绝不意味着基础换热与供液能力的重要性下降。无论是微漏识别、工质健康预测还是负载联动,所有智能化功能都建立在持续、稳定、可靠的液路运行之上。

以华为本次披露的 TMU 型号 FusionCol600-L450MA 为例,双泵配置下额定制冷量可达 450kW,额定流量 650L/min,可用压头 250kPa;单泵运行时仍可提供 360kW 制冷量、520L/min 流量与 180kPa 压头。额定工况下,一次侧进出水温 37/45℃,二次侧供回水 40/50℃,换热端差控制在 3℃,处于行业领先水平。

双泵与单泵的参数差异,也直观体现了冗余设计的实际价值:单泵故障时,系统仍可维持完整的冷却液循环与换热能力,仅额定制冷量下降约 20%。这意味着项目规划阶段,需根据单泵可用能力与实际热负荷匹配冗余度,确保单部件故障时仍有充足的供冷余量,避免算力业务受影响。液冷系统的可靠性,既取决于核心部件的配置等级,也取决于系统设计与负载的匹配程度。

此外,华为还公布了全链路的可靠性设计:交直流双电源热备,核心配电模块、传感器、水泵均采用 2N 冗余架构,主控、电源、驱动等关键模块支持热插拔维护,现场维护时间≤1 分钟。其中,电源与部件冗余用于保障供电切换、单点故障时的连续运行,热插拔设计则大幅降低了维护操作导致的停机需求。评估液冷设备的可靠性,需要同时考察运行连续性与故障状态下的剩余供冷能力两个维度。

液冷工匠观点

华为 TMU 的规模化推广,本质上标志着数据中心液冷产业正从 “工程普及阶段” 迈入 “智能升维阶段”。过去几年,行业的核心命题是推动液冷从小众方案走向规模商用,解决的是 “能不能用、够不够冷” 的基础问题;而随着 AI 算力密度持续冲高,液冷已经从配套的制冷设备,升级为支撑算力稳定运行的核心基础设施。

TMU 模式的真正价值,不在于替换 CDU,而在于重新定义了液冷设备的管理边界 —— 它打破了冷却系统与算力系统之间长期存在的数据壁垒,让冷源供给跟随算力负载动态匹配,让运维干预走在故障发生之前。对于全行业而言,这意味着液冷的竞争维度正在从硬件参数的内卷,转向系统级协同能力的比拼。未来,能够深度融合算力调度、实现 “热 - 电 - 算” 一体化联动的液冷方案,才会成为下一代智算中心的主流选择。

同时也需要看到,TMU 的全行业落地仍面临跨厂商接口标准不统一、跨领域协同机制不完善等现实门槛。华为凭借昇腾算力与能源基础设施的全栈布局率先迈出了一步,但整个产业生态的成熟,还需要服务器厂商、液冷设备商、IDC 运营商的共同推进与标准共建。



关键词:华为、  CDU、  TMU   编辑:LHK
版权与免责声明

1、凡来源标注为“产业在线ChinaIOL”的信息、数据及图片内容、报告及目录均为本网原创,著作权受我国法律保护。如需转载,请注明“来源:产业在线”。

2、本网站注明“来源为其他媒体与网站”的文字、图片和视频,转载是出于非商业性的信息交流之目的,并不意味着赞同其观点或认同其内容的真实性。

3、约稿或长期合作,请联系本网。

以上内容最终解释权归产业在线所有。

相关新闻