登录

首个全国产10万卡人工智能超集群正式投用“超级大脑”运转起来(深度观察)


速读:随着大模型规模提升、计算场景扩展和智能化应用的深入,亟须能够应对高并发、高吞吐、多精度和多任务负载的新一代算力基础设施。 “人工智能正在从大模型向智能体、具身智能快速演进,需要同时具备支持高精度的科学计算和低精度的人工智能训练的能力,这就要求计算系统在架构、规模、能效和可靠性上进一步创新。 “过去一年,我们基于国家超算互联网的底座,构建了若干科学计算智能体,将原来复杂的科学计算流程封装成简便易用的基于自然语言交互的智能体服务,已经覆盖100多个核心计算场景。 ”中科曙光高级副总裁李斌解释,这意味着,一个芯片、一个计算单元既需要具备对科学工程计算、数字计算仿真的支撑能力,也需要具备对神经网络类算法的支撑能力。 李斌介绍:“曙光8000覆盖双精度64位到32位、16位、8位甚至更低精度,也提供灵活混合精度调用能力,可满足科学计算、大模型训练、人工智能推理、工业仿真等计算需求。
首个全国产10万卡人工智能超集群正式投用 “超级大脑”运转起来(深度观察) _ 东方财富网

首个全国产10万卡人工智能超集群正式投用 “超级大脑”运转起来(深度观察)

2026年07月27日 05:54

  近日,我国首个全国产10万卡 人工智能 超集群——曙光8000正式落成投用,并同步接入国家超算互联网郑州核心节点。这标志着我国算力基础设施建设正式迈入10万卡级部署阶段。曙光8000投用首周已实现满载运行,日均处理作业数突破15万个,单日处理作业峰值超过50万个,已完成多项超智融合应用适配,覆盖大模型训练、 高通 量推理、科学计算等多个应用场景。

  在近日举行的2026世界 人工智能 大会暨 人工智能 全球治理高级别会议上,曙光8000被列入本届大会十大“镇馆之宝”。这台“超级大脑”如何炼成?它将在哪些领域发挥作用?

  将高精度科学计算与低精度智能计算能力统一到同一系统中

  超算和智算都是处理 海量数据 、支撑前沿科技的算力基础设施。超算主要立足科学研究,定位于大科学、大工程的问题求解,追求计算精度,如气象预测、飞行器设计、地震模拟等,都是它的应用领域;智算则偏重人工智能算法和模型创新,虽然对精度要求不高,但追求计算性能,支撑大模型训练与推理、自然语言处理、自动驾驶等人工智能融合应用。

  随着大模型规模提升、计算场景扩展和智能化应用的深入,亟须能够应对高并发、高吞吐、多精度和多任务负载的新一代算力基础设施。

  “人工智能正在从大模型向智能体、具身智能快速演进,需要同时具备支持高精度的科学计算和低精度的人工智能训练的能力,这就要求计算系统在架构、规模、能效和可靠性上进一步创新。”中国工程院院士李国杰说。

  “面对庞大而异构的算力需求,构建开放、高效、协同的计算生态,成为释放智能计算价值的关键。”中国科学院院士鄂维南表示。

  曙光8000就是在这一背景下研制的。作为超集群,曙光8000将成千上万张计算加速卡进行高速互联,在逻辑上将其整合为一台统一调度的“巨型 计算机 ”,从而提供超大规模的并行算力。

  “它采用了‘超智融合’的技术路线,将高精度科学计算与低精度智能计算能力统一到同一系统中。” 中科曙光 高级副总裁李斌解释,这意味着,一个芯片、一个计算单元既需要具备对科学工程计算、数字计算仿真的支撑能力,也需要具备对神经网络类算法的支撑能力。

  曙光8000正是这样一个面向多场景、多精度、多任务的 综合 型计算系统。李斌介绍:“曙光8000覆盖双精度64位到32位、16位、8位甚至更低精度,也提供灵活混合精度调用能力,可满足科学计算、大模型训练、人工智能推理、工业仿真等计算需求。”

  从千卡、万卡到10万卡,计算基础设施的建设逻辑也在发生变化。与千卡、万卡级系统相比,10万卡部署考验的不只是计算卡数量和理论峰值性能,更包括系统架构、网络互联、存储访问、能效控制、资源调度和工程交付能力。

  系统创新造就“超级工程”

  这样一个巨大的 综合 型计算系统,是名副其实的“超级工程”:30亿颗 电子 元器件实现精密协同,互联线缆总长超1600公里,系统总重1500吨……而这一切,需要被压缩在不足0.05毫米的结构组装精度之内——甚至比一张普通A4纸还薄。

  在系统建设上,曙光8000具有“芯片、计算、存储、网络、散热、应用、服务”全链路全自研人工智能基础设施能力,从核心部件的研制到系统落地均实现全国产化。

  “从万卡到10万卡,不是简单乘以10,更要在规模扩大之后让它‘跑’出应有的性能效率。”李斌举例,算力协同方面,随着体系结构向复杂的异构计算演进,任何计算或网络节点的短板,都会导致整体性能大幅衰减;系统可靠性方面,元器件数量上升会导致理论故障率的上升,系统架构的复杂化又会进一步加剧维持稳定运行的难度。

  应对这些挑战,并没有太多的捷径可走。曙光8000研制过程中,任何一个板卡所要求的可靠性都要比通用计算设备高出一个数量级。而供电、冷却等支撑系统的设计和制造环节,更是耗费了团队大量的心血,用李斌的话说,“曙光8000需要的是前所未有的系统创新”。

  值得一提的是,国产算力芯片及基础软硬件生态的长足进步,为曙光8000系统建设提供了重要支撑。比如,曙光8000应用的分布式存储技术,在今年6月发布的全球存储系统性能基准测试IO500榜单中,取得生产型全节点和10节点榜单“双榜第一”的好成绩。这套存储系统能够支撑大模型训练和科学计算中的 海量数据 读写,保障大规模集群高效运行,证明国产高端存储技术已在全球算力体系中具备领先实力。

  我国自主研发的相变浸没液冷技术,为应对大规模计算集群散热挑战提供了新途径。 曙光数创 高级副总裁张鹏介绍:“曙光8000将全部计算设备浸没在氟化液中进行降温。氟化液沸点在50摄氏度左右,而设备运行温度在80至90摄氏度之间,当设备运行温度上升后,氟化液就会沸腾相变,并由传输管道进入冷凝器,冷却后的气体再次转换为氟化液,可实现闭环循环利用。”

  此外,高速网络、 数字孪生 运维和多元融合调度等技术,共同提升了超大规模集群的运行效率和应用适配能力。在业内专家看来,打通芯片、整机、基础软件到智能应用的全栈国产化链路,构建新一代智能基础设施,具有深远的战略意义。

  支撑算力产业“攀高峰”“建高原”

  建好更要用好。作为全国首个10万卡级超算、智算融合的算力资源池,曙光8000投用后即同步接入国家超算互联网,并依托国家超算互联网接入全国一体化算力网,面向科研院所和产业用户提供算力服务,支撑气象预测、材料设计、能源勘探、生物医药、量子计算、流体仿真、工业仿真、大模型训练与推理等场景,并形成更大范围的算力协同和应用支撑。

  “我国算力产业既要‘攀高峰’,也要‘建高原’。”国家高性能 计算机 工程技术研究中心副主任曹振南说,“攀高峰”就是采用自主技术,研制世界上顶尖的 计算机 和系统;“建高原”就是依托国家超算互联网,把机器、超算中心连接起来,更把人才、应用和生态连接起来。

  2024年4月,由国家部委指导发起建设的国家超算互联网正式上线,已建成汇聚超350万CPU(中央处理器)核、25万GPU(计算加速卡)卡的全国规模最大一体化算力网络与应用服务平台。国家超算互联网郑州核心节点上线后,国家超算互联网面向新用户推出普惠资源包,包含200卡时算力、1000万词元调用额度和500G存储资源,并可选用主流大模型。高校师生和青年科研团队可以用更低成本完成模型测试、算法验证和科学计算实验;人工智能开发者和中小企业则可以在正式投入前快速完成应用原型搭建和模型验证。

  国家超算互联网总工程师郭庆介绍,除支撑重大科研攻关外,国家超算互联网正推动算力向更广泛的用户群体渗透,目前国家超算互联网累计用户超140万,用户平均年龄持续降低,从中学生到专业科研人员均可接触到高端算力资源。

  据介绍,曙光8000已完成300余项重点应用深度适配,覆盖20多个行业领域。在典型场景中,该系统已支撑新一代气象大模型开发部署,推动能源领域核心成像算法在国产化平台上的移植优化,并在生物、材料、流体等领域支撑蛋白质折叠过程模拟加速等超大规模任务。

  “过去一年,我们基于国家超算互联网的底座,构建了若干科学计算智能体,将原来复杂的科学计算流程封装成简便易用的基于自然语言交互的智能体服务,已经覆盖100多个核心计算场景。”曙光智算总裁何牧君介绍。

  曙光8000不仅是单项技术突破和产品创新,更是产学研用协同的成果。近年来, 中科曙光 围绕国产通用计算平台构建产业生态系统联合体,旨在解决国产计算平台生态碎片化问题,推动自主可控信息技术生态的发展,目前已汇聚超过6000家产业合作伙伴,共同推动我国计算产业发展。

(文章来源:人民日报)

主题:新股|基金|美股