800伏直流AI数据中心会出现哪些故障风险
大电流引发的电火花与火灾会造成代价高昂的停机事故,还会带来人身安全威胁。芯片过热同样会衍生各类问题。
核心要点:
随着电压等级提升,电气故障、电弧闪络、热失控事件频发,人员安全成为首要考量。
热插拔电路、固态断路器以及其他保护器件,在承载大电流的同时保障人员安全。
数据中心正在借鉴汽车行业的芯片可靠性技术,但 800V 直流对应的标准与协议体系尚未完善。
随着人工智能在全社会落地,现代数据中心的电力需求持续高涨,未见回落迹象。单机架功耗正逐步接近 1 兆瓦,这就对从供电侧到芯片端的高效电能传输提出更高要求。其中一个可行方案,就是用 800V 直流 替代传统机柜内部 48V 直流配电体系。
电压升级会带来诸多收益。是德科技电源电子设计软件产品经理史蒂文・李表示:“800V 架构减少功率变换级数,降低损耗,整体能效更优。对于数据中心场景,宽禁带半导体技术优势尤为突出。厂商会尽可能选用这类半导体材料,因为其损耗更低、耐热性能更强。对比传统硅材料,氮化镓可以承受更高温度而不发生击穿。”
但电压抬升也带来安全与可靠性难题,尤其是运维人员执行热插拔服务器机箱作业、保障业务不中断的场景。英飞凌电源与传感器系统事业部总裁亚当・怀特谈道:“数据中心机架满负荷运行时,如果需要更换主板部件,最忌讳业务受到扰动。同时必须确保拔出主板的工作人员不会置身危险之中。随着冲击电流急剧增大,该问题的重要性还会进一步放大。”
48V 与 800V 存在巨大差异。史蒂文・李指出:“高电压的危险性会显著提升。48V 一般不会致人死亡,但 800V 存在致命风险。数据中心的设计诉求是,某一区域发生故障时,可以通过热插拔替换设备、重新上电,保障业务负载,这和电网逻辑类似 —— 电网局部故障后,会调度其他区域电力保障用户供电。但 800V 工况下,如果热插拔操作不当,就会产生电力电弧,伴随巨大爆破声响与火花,甚至器件烧毁、炸裂,高压场景下的安全隐患切实存在。”
隔离防护机制与热插拔电路的重要性由此凸显。德州仪器计算电源技术专家普拉迪普・申伊表示:“当需要取出、重新插回机箱单元时,热插拔电路可以实现防护,安全完成设备下线与上线维护。高电压场景下这一点必须纳入设计考量。电动汽车领域不存在同类问题,这是数据中心独有的挑战,如何安全完成 48V 向 800V 的过渡是一大难题。”
安全导向的架构设计,要求工程师在高压系统与低压系统之间维持最小安全绝缘距离,这是数据中心整体设计必须考量的要素。
电压等级越高,系统复杂度也随之上升。英飞凌工业绿色电源事业部总裁彼得・瓦沃尔说道:“其中包含电流检测,用于感知系统工况;还需要对跳闸保护逻辑进行编程。机电类保护器件规格繁多,而半导体方案可以依靠软件完成定制。未来该特性将简化整个供应链。过去需要储备大量不同规格物料来匹配多样需求,现在仅依靠软件配置即可,高成本方案也会因此获得更强的市场竞争力。”
一份西门子白皮书指出:800V 直流具备布线施工更简单、变换效率提升、无功功率降低、便于集成备用电源与各类能源等优势。但直流配电同样面临功率变换传输、电磁兼容、计量方面的挑战。直流配电系统本身呈现容性特征,网络中大量电容挂接在直流母线上并存储工作能量;一旦故障发生,电容释放储能,故障电流急剧放大、直流电压剧烈扰动,带来安全风险与系统停机。
因此,数据中心直流配电保护设计,必须统筹布线接地、保护器件、保护协同、电弧闪络抑制、接地故障防护等多个维度。
保护器件
在保护器件层面,固态断路器(SSCB)相对机械断路器具备多重优势:亚毫秒级故障保护、无电弧、使用寿命大幅提升,还可以与智能物联网预警预测系统无缝对接。
机械开关在交流系统中可以正常工作:交流电方向周期性反转,每秒多次过零点,每次过零,电弧就会自然熄灭。但直流电方向恒定,不一定会出现电压过零点。如果在带电直流回路中断开机械开关,电能会持续击穿空气间隙,形成持续高温电弧,会烧毁开关甚至引发火灾。固态断路器依靠电子方式微秒级切断电流,不存在物理分断间隙,从根源避免持续性电弧生成。
是德科技的史蒂文・李说:“传统机械断路器响应时间在毫秒级别,速度不够。而直流工况响应要求极高,800V 系统尤甚。直流不一定会出现电压过零,但固态开关、固态断路器可以检测电弧,相比机械设备实现更快关断,规避危险,这也是固态断路器研发的核心动因。”
“固态断路器依靠物理机制完成检测。一旦检测到短路,就执行关断动作。它并非依靠复杂智能算法,核心是物理效应,内部没有控制器、机器学习芯片。器件会监测额定电压,一旦检测到电压归零,代表出现故障,就直接完成分断,完全依托材料本身特性实现。”
业内普遍认为,针对 800V 直流架构,固态断路器的表现优于机电继电器与机械断路器。英飞凌的彼得・瓦沃尔表示:“机电器件可靠性不错,成本低廉,但响应速度慢。故障发生时,很可能还没完成保护动作,受保护设备就已经损坏。基于半导体的断路器,能将保护响应速度提升数个数量级。”
断路器是电气系统的基础部件,覆盖极宽电压区间,小至 63 安培电机保护微型断路器,大到数千安培等级设备。瓦沃尔介绍:“每栋建筑地下室都会设置大量断路器,用于建筑本身与进线供电保护。机电、电气专业人员可以处理数千安培级别的分断。该市场器件规格跨度很大,从 70‑150V、1000V 以上耐压的分立器件,一直延伸到更高电压、大电流等级产品。”
西门子资料显示,还有 固态混合断路器(SSHCB) :导通阶段使用金属触点,和机械断路器一致;故障分断则依托电力电子器件,逻辑类似固态断路器。电子熔断器(E‑fuse)属于智能固态过流保护器件,和固态断路器相似,但没有集成物理隔离气隙,因此不能作为支路保护器件。
图 3:数据中心电源管理(图片来源:英飞凌)
图 4:保护器件定性对比表(图片来源:西门子) 固态断路器在车载电池防护领域同样具备价值。英飞凌瓦沃尔谈道:“当前出于成本考量,汽车电池普遍使用爆破式熔断器。一旦熔断器起爆损坏,车辆就需要送修。固态断路器可以实现非破坏性保护,不会直接损毁器件。”
热管理考量
瞬时火花固然危险,但数据中心更普遍的问题是全系统的热问题。楷登电子高级首席产品工程师黄 tram(Hoa Tram)表示:“大量 GPU 同时运行,产热速率极高,规划与运维需要更全面主动的方案。依靠温度阈值触发告警这类传统手段仍有必要,但必须补充数字孪生等新技术,可以提前数分钟乃至数小时仿真 AI 数据中心热状态。这不仅有助于 GPU 集群负载的高效调度,还能为运维人员、冷却系统争取宝贵时间,规避、缓解热损伤。高密度 GPU 环境下,热损伤的发展速度远高于传统架构的数据中心。”
预测能力至关重要。是德科技的史蒂文・李说:“大功率、大电流变换器会大量发热。核心难题在于仿真、预判产热,设计散热系统把热量高效带走。很多电路板配备大型散热器,消散 MOSFET 产生的热量;大型数据中心散热方案更加复杂,液冷管路遍布整机柜。而实现这些,首先要明确边界条件:我需要处理的最坏产热工况是什么?如果预判不准,就会出现过热,器件烧毁、业务中断,引发停机。”
数据中心与汽车行业:可靠性需求与标准
出于对效率、可靠性的追求,数据中心与汽车行业互相借鉴技术创新,部分功能安全标准也从安全关键领域迁移到业务关键的数据中心领域。
Imagination Technologies 产品管理副总裁克里斯托夫・比茨说:“汽车是我们深耕数十年的核心市场,数据中心算是新兴市场。我们发现很多为满足 ASIL‑B 甚至 ASIL‑D 等级开发的可靠性机制,对数据中心同样意义重大。设备发生故障而无法被感知,会浪费巨量算力与时间。故障检测速度越快越好,很多故障属于硬故障。数据中心环境温度高、辐射复杂,芯片会出现失效。因此我们在硬件内置低成本持续自检机制。”
汽车领域要求 100 毫秒内完成故障识别并上报。比茨表示:“现在的数据中心还达不到这个水平。数据中心运行规模巨大,经常要等到执行任务时,才发现某一块 GPU 已经损坏,之后需要回滚业务,定位故障源,排查脏数据。我们的方案可以实现极速故障检测,受到数据中心客户的关注。故障检测之后,业务回滚窗口大幅缩小。同时不仅可以判断‘是否发生故障’(汽车领域的核心诉求),还可以定位故障具体位置,只将故障单元下线,其余大量 GPU 继续运行。不用前往现场、拔出机柜整机替换。我们仅禁用故障计算单元即可。当然该部分硅片已经不可信,后续合适时机依旧要完成物理更换,但可以大幅缩短中断时间、降低成本。”
与此同时,数据中心的可靠性要求还在持续抬升。楷登电子的 Hoa Tram 提出观点:“数据中心的可靠性要求甚至高于汽车。汽车系统尽可能做到隔离、独立运行;而 AI 数据工厂需要同步调度海量高功耗 GPU,功率规模完全不在一个量级。汽车启动电机的工作状态,不需要关心车灯。车载负载是事件驱动,由人为操作、路面工况触发,不存在跨集群算法同步。”
大型 AI 训练集群中成千上万 GPU 深度协同,矩阵运算阶段同时冲到算力峰值,同步、检查点阶段又同步回落。Tram 解释:“故障瞬态不是单台负载冲击,而是一整套关联设备同步出现功率尖峰。这会把局部电能质量问题放大为有可能扰动电网的事件,这是汽车电气工程师完全不需要面对的场景。汽车电池不用考虑自身瞬态吸收特性会造成区域性停电,影响数十万、上百万普通人的生活。AI 工厂电源系统灾难性故障的影响范围巨大,这也是数据中心引入数字孪生等前沿监测仿真技术的重要动因。”
无论是新建还是改造升级的数据中心,一大现实阻碍是 800V 直流安全标准尚未完全成熟。Hoa Tram 说道:“例如 NFPA 70E 虽然原则上覆盖直流系统,但电弧闪络计算方法主要基于交流系统,用于直流场景准确度有限。IEC 61439‑1:2020、UL 508A 第三版涉及直流开关柜与控制面板,但并未专门针对 800V 大规模数据中心场景。OSHA 职业安全规范引用 NFPA 70E 作为电气安全依据,并未明确针对 800V 直流数据中心架构。”
汽车与数据中心的差异,还体现在器件认证体系。英飞凌吉姆・帕夫洛斯基表示:“汽车整车厂遵循 AEC 系列标准,部分器件工作温度高达 175℃。传统数据中心使用工业标准,和汽车标准并不等同。但现在数据中心的器件认证门槛不断抬升,甚至超过汽车行业,因为追求极高可靠性,不希望单台电源故障带垮大批服务器。”
变压器、母线排等功率变换与配电部件,必须适配 AI 数据中心的波动负载。新思科技应用工程总监帕瓦尼・戈蒂帕蒂谈道:“这类器件的核心挑战是高效运行,降低电气损耗。AI 负载带来的谐波会产生局部交流损耗与热点,造成器件失效,引发机柜停机,损害数据中心业务,更严重时造成租户业务中断。多物理场仿真优化工具,能够辅助设计出电气、热鲁棒性更强的功率变换与配电方案。”
芯片封装层面同样需要考量。戈蒂帕蒂补充:“高功率密度芯片给 AI 数据中心带来更强算力,也要求芯片周边电气架构匹配不断提升的功率密度。芯片与封装环节会用到磁性材料来提升功率密度;芯片设计人员必须考量,磁性材料集成到电路板后,不能引发电磁干扰(EMI)。”
可靠性挑战不只局限于供电与封装,液冷 AI 机柜内部大量器件还需要保障可维护性。
液冷 AI 机柜的内存与可维护性
现代高性能 AI 服务器对可用性、可管理性、可维护性、可靠性提出严苛要求,内存也不例外。Rambus 内存接口芯片产品营销副总裁约翰・埃布尔表示:“AI 基础设施持续扩张,数据中心运营商需要内存方案,兼顾性能、能效,同时保障不间断运行所需的可靠性与可维护性。例如 SOCAMM2 采用基于 LPDDR 的模块化内存架构,适配液冷整机形态,支持现场升级、现场更换,实现全生命周期灵活管理;配套芯片组提供遥测、配置管理与本地化电源管理,支撑大规模可靠运行。”
液冷系统本身同样需要可靠性验证。
德州仪器的普拉迪普・申伊表示:“整套系统包含大量泵、电机驱动器,液体需要循环流动。换热器等部件带来泄漏检测这类全新挑战。过去设备只靠风冷;现在液冷普及,必须把全部器件温度维持在规定区间,否则就会超出额定规格,出现损坏。”
板级可靠性测试(BLR)可以完成温度循环验证。申伊说:“我们开展温度循环测试,刻意将器件加热到高温,再冷却到低温。”
虽然数据中心温控条件优于车辆,但温度循环对两类设备都会带来负面影响。英飞凌吉姆・帕夫洛斯基指出:“冷热反复循环是电子器件一大杀手,会弱化芯片内部互连,或者芯片与封装之间的连接。认证测试需要验证器件可承受的循环次数,部分工况下,数据中心的严苛程度甚至超过汽车应用。”
但汽车整体工作温度更高。新思科技首席工程师布莱恩・凯利谈道:“数据中心属于固定设施,不会出现电动汽车、混动汽车那样剧烈、快速变化的电气负载;同时机房环境受控,维护条件更优。”
结语
切换至 800V 直流,能够提升 AI 数据中心能效,但也带来更高安全风险:触电、电弧闪络、电池热失控、设备隔离防护难题。因此,从电网 / 备用电源,到单机功耗突破 1MW 的高密度 AI 机柜,配电系统的每一个环节,都必须落实安全防护手段。
芯片可靠性也是 800V 直流安全体系的一环 —— 变换级数减少,高压电力距离处理器芯片仅有数英寸。展望未来,随着 AI 应用持续拓展,权衡各类风险,换取电能节约与能效收益,具备现实价值。