AI算力时代数据中心供电架构升级:从12V到48V与高压直流

2026-08-31 12:06:2629 阅读量

OmniOn Power这几天放出了一个消息:要进一步加强面向全球数据中心的电源架构产品组合。做数据中心运维和规划的朋友应该都明白,这条新闻的分量不在于“某家厂商发了新品”,而在于它恰好踩在了一个关键节点上——AI算力爆发把数据中心机柜功率密度推到了前所未有的高度,传统供电架构正在经历从12V到48V、从交流UPS到高压直流的系统性换代。这个时候一家老牌电源厂商突然宣布加码,背后传递的信号很清晰:数据中心供电架构的升级窗口期已经到了。

相关服务:台湾高防服务器

这篇文章我想结合实际运维经验,聊聊数据中心供电链路到底怎么走、OmniOn Power这类电源厂商在产业链里扮演什么角色,以及如果现在要规划一套面向未来五年的供电架构,有哪些坑必须先避开。内容适合数据中心运维工程师、机房规划人员,以及关注算力基础设施投资的读者。

AI算力时代数据中心供电架构升级:从12V到48V与高压直流

1. 项目背景:OmniOn Power是谁,这条消息到底在释放什么信号

1.1 从ABB分拆出来的老牌电源玩家

先简单捋一下OmniOn Power的来龙去脉。它原本是ABB集团旗下的电源转换部门,再往前追溯,这个团队最早来自Lineage Power,是做电信和网络设备供电起家的老牌厂商。2022年前后,ABB把这个部门出售给了中国台湾的康舒科技(AcBel),交易完成后团队独立运作,正式更名为OmniOn Power。

很多人可能对这个名字还不太熟,但它在电源行业里的积累相当深。过去二十年里,全球大量通信基站、网络机房、数据中心用的整流器、DC-DC转换器、电源监控系统,都出自这个团队。独立之后再来看这个动作,本质上是把原本附属于大集团的电源业务,变成了一个可以更聚焦、更快速响应的专业公司。

从行业视角看,这次“加强数据中心电源架构产品组合”的宣布,意味着两件事:第一,OmniOn Power要把资源向数据中心倾斜,而不是像以前那样在通信、工业、数据中心多个市场平均用力;第二,他们赌的是未来几年数据中心供电架构会有一个大的升级周期,谁先补齐产品线,谁就能吃到这波红利。

1.2 数据中心功率密度暴涨,供电架构到了换代临界点

我们再看看市场背景。过去十年,普通机柜的功率设计通常在5到10千瓦,一个机房几千个机柜,总负载也就几十兆瓦。但AI训练集群落地之后,单机柜功率直接从10kW跳到了40kW、60kW,甚至液冷方案下做到100kW以上。

这对供电架构的冲击是根本性的。传统12V母线架构下,功率每提升一档,铜排和电缆的截面就要跟着加大,损耗也指数上升。到40kW以上的机柜,12V架构已经很难做到高效率和高密度并存。于是行业开始整体向48V机架级供电、800V高压直流方向迁移。

全球几大云计算厂商其实都已经在推自己的供电标准:有的走开放式机架,有的推整机柜级电源,有的直接上高压直流。但无论哪种路线,最底层都需要一套从市电到服务器主板的全链路电源产品,这恰恰是OmniOn Power这类厂商的看家本领。

2. 数据中心供电架构的核心链路:从电网到芯片的电,到底走过了哪些环节

2.1 经典交流架构:UPS加PDU的老路径

理解OmniOn Power的价值,得先把数据中心供电链路拆开看。传统方案里,市电进入机房后大概要经过这样几个环节:高压配电柜、变压器、ATS(自动转换开关)、UPS(不间断电源)、精密配电柜(PDU)、机柜内电源分配单元,最后进到服务器内部,由服务器电源模块(PSU)转成12V母线给主板和硬盘供电。

这条链路里,UPS是最关键的设备,负责在市电异常时用电池续命。UPS的系统架构一般有在线双变换式、互动式、后备式,数据机房几乎清一色用在线双变换式。它的原理简单说就是:交流电先整流成直流给电池充电,同时逆变器随时把直流再逆变成交流给负载供电,中间电能经过了“先交后直再交”的过程。

这套方案的优点是成熟、稳定,产业链极其完善,运维人员对它最熟。缺点也明显:电能多翻了几道手,每一道都有损耗。UPS本身效率即便做到96%,加上配电环节、服务器PSU的转换损耗,整链路从市电到芯片的累计效率往往只有80%上下。这在过去电费不敏感的年代可以接受,现在电价高企、碳排放考核压头,很多企业已经忍不了。

2.2 高压直流HVDC架构:省掉逆变环节的“直来直去”

为了减少中间转换,行业里出现了高压直流(HVDC)架构。典型的方案是市电整流后直接输出380V直流,经过直流配电柜到机柜,机柜里的电源模块再把380V直流降到48V或12V供服务器使用。

HVDC最大的优势是省掉了UPS里“直流再逆变成交流”的环节,又省掉了服务器PSU前端PFC(功率因数校正)部分,整体效率可以提升5到8个百分点。对于几十兆瓦级的数据中心来说,每提升1个百分点的效率,一年省下的电费就是百万级。这也是阿里、腾讯、字节这些国内互联网公司前几年大规模拥抱HVDC的根本原因。

不过HVDC不是没有代价。直流断路器的可靠性要求更高,直流电弧也比交流难熄灭,防护标准更严格。另外一个现实约束是,大量现网服务器电源还是按交流输入设计的,切换到纯直流环境需要适配,这在混合演进期是个不小的工程。

2.3 大功率AI集群里的供电新挑战:48V与800V母线并行

到了GPU集群这类AI算力场景,又出现了新的变化。单块GPU功率已经摸到700瓦到1000瓦,一张AI加速卡背后的供电诉求甚至跟一台传统服务器相当。服务器电源输出从12V升级到48V,几乎是板上钉钉的事——12V在几百安的电流面前无法兼顾损耗和体积,48V可以把电流降到四分之一,线缆和连接器压力小很多。

再往上是整柜级800V直流母线。一个AI机柜动辄几十上百千瓦,如果用48V往里送,电流要跑到几千安,完全不可行。所以目前行业的方向是:机房层用800V或380V高压直流,机柜层做一次降压到48V,再到GPU板卡附近用高效率的DC-DC模块降到芯片需要的电压。

这一路拆下来你会发现,供电环节不仅没有减少,反而因为功率密度提升,每个环节的技术含量都在变高。从“拿个整流器把交流变直流”,变成“全链路高效率的电能变换和分配”,这对电源厂商的研发能力提出了完全不同的要求。

3. 产品组合拆解:一场电源架构升级需要哪些关键设备

3.1 前端的整流器和AC-DC电源模块

不管走交流UPS还是高压直流,电源链路的第一道硬关卡都是把市电交流电转成可用的直流电,这个环节的核心设备就是整流器,行业里也叫开关电源模块。

传统通信机房用的整流器多是48V输出,密度和效率这几年提升非常明显。早期模块效率做到94%就算不错,现在主流厂商的钛金级模块能做到96%到97%。整流模块还有一个重要特性是热插拔和N+1冗余并联,某颗模块挂了,系统能自动均流顶上,运维都不用断电就能更换。

AI机房功率密度上来之后,对整流器的要求也在变:单模块功率从3kW往6kW、8kW甚至更高走,输入电压范围要宽(适应不同国家和地区的电网),功率因数要做到0.99以上,还要能承受突发的负载跳变——GPU集群的功耗可谓“一分钟前还平稳,下一分钟直接满负荷”,这对电源模块的动态响应能力是个硬考验。

3.2 中后段的DC-DC转换器与板载电源

整流器把市电变成直流之后,后面还需要一系列DC-DC转换器把它降压到设备可用的电压。这其中包括机柜级的中间母线转换器、服务器电源模块、板卡上给CPU/GPU供电的VRM(电压调节模块)。

DC-DC这块最核心的指标是转换效率和功率密度。高端中间母线转换器在高负载下要做到96%以上,不然一个大机柜下来,热量全部积在机柜内部,散热成本跟着飙升。板级的VRM则更强调瞬态响应,CPU从闲时到满载可能就在几微秒内,电压波动超过几百毫伏就可能引发系统重启。

这类产品的选型思路跟前端整流器很不一样。前端整流器讲究的是皮实耐用、好维护,后端DC-DC讲究的是精雕细琢、电气性能极致。一家电源厂商想打通全链路,前后两端都得有拿得出手的东西,这正是完成并购整合后OmniOn Power这类厂商想讲的故事。

3.3 UPS与高压直流成套方案

除了裸电源模块,数据中心还需要成套的供电系统方案。UPS从几百千伏安的模块化塔式到几十千瓦的小型机柜都有,高压直流则需要整流柜、蓄电池接入柜、直流配电柜、监控系统协同工作。

这一块我认为最重要的反而不是单体设备参数,而是系统级的协议和兼容性。电池管理、输入输出开关、防雷、绝缘监测、烟气联动,任何一个环节缺失,都可能在未来某次故障里变成事故导火索。过去我们踩过不少坑:单看某厂商的模块挺好,但配了自己家的监控软件才发现协议不开放,后续扩容只能继续买他家东西,价格坐地起价。所以现在规划项目,我一律要求供应商承诺开放关键接口。

3.4 数字化监控与能源管理软件

纯粹硬件级别的供电架构在今天已经没有太大壁垒了,真正决定体验差异的往往是那套藏在后面的管理软件。一个完整的电源管理系统,要能实时显示每个机柜的电流、电压、功率、电能质量,要做电池组的健康度预测,要在发生负载跳变时给出告警和趋势预判。

有些厂商把这套软件做成了闭环控制:发现某路负载偏高,自动在机柜间做负载均衡。这种能力听起来简单,真做起来非常考验算法和长期数据积累。OmniOn Power这类老牌厂商在软件层面其实有天然优势——它们从电信时代就在做远端电源监控,积累了大量的设备运行数据和故障模式库。

4. 实操建议:如果现在规划一套面向未来五年的供电架构,应该怎么做

4.1 先算清楚功率账,再谈架构选型

不管厂商宣传多么天花乱坠,回到自己机房,一切都得从负载算起。我做规划有个习惯,第一步永远是做功率模型,表格里至少要有三列:现状负载、三年预期负载、峰值冲击负载。

以典型的AI训练机柜为例,假设单柜设计功率60kW,一栋楼规划500个机柜,满载就是30MW。加上制冷、照明等辅助设施,电力需求通常在45MW到50MW左右。这时候就要考虑:土建电源容量够不够?变压器容量够不够?柴发备用容量按什么比例配?如果原本的规划是10MW,现在一下跳到50MW,牵扯的是从市政供电到楼宇配电的整套扩容,工程量极大。

功率模型的另一个用途是定电压架构。总功率在5MW以下、以通用计算为主,经典12V交流UPS架构仍然够用;到了10MW以上且以GPU类高密度负载为主,就应该认真考虑HVDC加48V机架级供电的路线。

4.2 冗余策略怎么选:N、N+1还是2N

供电冗余等级直接决定可用性,也直接决定造价。N代表满足负载所需的最少设备数量,N+1就是多一台备用,2N等于整套系统翻倍。

对一般互联网业务机房,N+1的UPS和双路市电基本够用,可用性可以做到99.99%以上。对于金融、核心交易系统,则普遍上2N架构,甚至2N+1。但在AI机房这个场景里,我倾向于按业务等级混合设计:存储和核心网络用2N,GPU计算节点用N+1加快速切换。

理由很简单,GPU训练任务挂了,通常可以断点续训或重启任务,损失一两个小时可以接受;但存储系统挂了,丢的是数据,那是不可逆的。把资源花在刀刃上,比整齐划一地堆冗余更符合运维实际。

4.3 电压架构、散热与供电系统需要联动规划

供电架构从来不是一个独立决策。你选了48V供电,机柜内部的铜排、连接器、背板全要跟着换规格;你选了高压直流,服务器电源模块必须支持直流输入;你看到机柜功率密度提上去了,散热方案大概率也得从风冷换成液冷。

所以规划和选型的时候,我强烈建议把供电和散热放在同一个表格里算总账。一个60kW的机柜,即便供电效率做到97%,留在机柜里的热量仍然有接近2kW;这还没算IT设备本身散热的传导路径。如果散热不到位,供电设备温度一高,寿命和效率都会直线下降,形成恶性循环。

4.4 供应商评估时重点看哪些维度

市面上电源供应商不少,但真正能提供全链路系统级方案的不多。评估一家供应商,我个人的标准排序是这样的:可靠性记录、软件生态、可服务性、价格。

可靠性记录最直接的办法是看公开的第三方测试报告和现网案例,不是看PPT上的MTBF数字。软件生态要看管理平台是否开放API,能否接入现有的DCIM(数据中心基础设施管理)系统。可服务性则要看备件供应周期、售后响应速度和驻场工程师能力。价格放在最后,是因为供电系统的生命周期通常是10到15年,一次性采购成本摊到每年几乎可以忽略,后续的电费和维护成本才是大头。

5. 常见问题与排查技巧实录

5.1 机房配电柜频繁跳闸,问题出在谐波

有次排查一个机房的总配电柜跳闸故障,负载率明明只有60%,电流表读数却高得离谱,最后用电能质量分析仪一测,发现3次、5次、7次谐波含量严重超标。原因是机房里大量开关电源设备的PFC电路工作异常,谐波电流在中线叠加,导致中线电流甚至超过了相线电流。

这类问题的排查思路是:先用钳形电流表测中线电流,再用谐波分析仪确认频谱,最后定位到具体设备批次。治理手段无非两种——加装无源滤波器,或者逐台排查并更换内部PFC故障的电源模块。从根上讲,采购电源设备时坚持要求输入电流谐波THDi小于5%,能在源头省掉很多麻烦。

5.2 多模块并联不均流,某台电源模块过热

整流器和电源模块并联使用时,不均匀是一个经典故障。现象是界面监控显示模块负载率差异很大,有的模块50%,有的模块已经90%,且后者温度明显偏高。

排查顺序一般是:先检查模块间通信线是否正常,很多系统依靠通信线同步均流信息;再检查输入电压是否一致,个别模块输入线过长导致压降差异;最后看模块固件版本是否统一,混用不同固件很容易出现均流算法打架。这类问题建议在预防侧下功夫——新装模块必须同批次、同固件、同配置,上线前做一次满载均流测试。

5.3 效率不达标,PUE居高不下

经常有朋友问,为什么我机房效率测出来总是跟宣称值差一截。我通常会反问一句:你的效率是在什么负载率下测的?供电设备的效率曲线通常是U型,在50%到80%负载率区间最高,轻载和重载都会回落。

比如一个标称96%效率的整流模块,实际负载率只有20%的时候,效率可能掉到91%以下。很多机房为了冗余,把供电系统配得很大,实际负载却只有三分之一,结果PUE被拖得很难看。解决方法是把设备分批运行,让在线运行的模块尽量保持在60%到80%的黄金负载区间,而不是所有模块平均分负载。

5.4 电源监控软件与DCIM对接困难

监控对接是个很容易被低估的环节。采购电源系统时,供应商说有完善的监控平台,等到要接进公司现有的DCIM系统,才发现接口只支持私有协议,或者开放出来的字段少得可怜,连单机柜功率都没有。

我现在要求供应商在投标时就要提供API文档样例,写清楚哪些数据字段可以开放、刷新频率多少、采用什么认证方式。同时会在合同里约定,监控接口不开放视同验收不合格。这一点上,国际化厂商通常做得更规范,因为它们要面向全球不同客户的集成需求。

5.5 电池健康度被忽略,断电才发现撑不住

供电系统里的电池组是个隐性问题。平时有市电,电池看似一切正常,一旦真停电,可能撑不到柴油发电机启动就掉链子。铅酸电池对温度非常敏感,机房里又普遍存在局部热点,同一个电池组里不同位置的单体状态可能差异很大。

建议每季度做一次电池内阻检测,每年做一次核对性放电测试。别过度依赖电池管理系统的自动检测,很多系统只是电压巡检,内阻上升初期电压根本看不出来。有条件的数据中心可以引入电池健康度预测算法,通过历史充放电数据识别落后单体,提前替换。

写在最后的一些体会

做了这么多年基础设施,我的总体感受是:供电架构是一个典型的“决策时感觉不重要、七年后发现选错了代价很大”的领域。前期多花三个月做负载模型、多跑几个供应商做方案对比、多坚持几项接口和能效要求,后期节省的远不止是电费,更是一整支运维团队的精力。

以前我们规划一个机房,考虑三到五年的扩容周期就够了。现在技术迭代节奏明显加快,AI负载的增长曲线让很多过去的“长期规划”变成了“短期过渡方案”。我的建议是:在架构选型上,尽量往标准化、开放性、可演进的方向靠。不要被某一家厂商的私有方案绑死,不要为了省初期成本牺牲能效指标,不要忽视软件管理平台的价值。

OmniOn Power这类厂商加码数据中心供电市场,本身也说明行业判断是一致的——供电架构的升级窗口已经打开。至于怎么选择,最终还是得回到你自己的负载模型、预算和运维能力上去,没有放之四海而皆准的答案。

本文地址:https://www.idc504.com/news/9_223998.html