登录

国产算力利用率分化,异构调度成新焦点


速读:不同引擎支持的模型架构、量化方式和芯片环境存在差异。 江鹏在采访中表示,模型架构和硬件型号不同,性能优化效果差异很大。 这家公司2024年开源了同名AI基础设施平台,最初侧重GPU集群管理,现在把模型部署、推理引擎适配和Token服务放到了更重要的位置。
国产算力利用率分化,异构调度成新焦点 _ 东方财富网

国产算力利用率分化,异构调度成新焦点

2026年09月15日 20:56

作者:

孔海丽

  国产算力产业来到分水岭,GPU采购量持续增长,真正能够稳定输出的Token却未必同步增加。

  IDC与中国信通院今年面向250家企业开展的调研显示,近半数受访企业的智算资源利用率处于51%至70%,另有6.7%的企业处于31%至50%。制造、政务等行业中,利用率达到70%以上的企业占比不足35%。部分自建项目完成了服务器和GPU部署,但统一调度、资源池化、软件适配和动态分配系统仍有缺口。

  这类现象在行业内被概括为“重硬轻软”。

  芯片提供理论算力,模型部署和推理服务需要整套软件链配合。驱动、算子库、 通信 组件、推理引擎、存储和网络,任何一环出现问题,GPU都可能跑不满,甚至跑不起来。

  国产GPU进入更多 数据中心 以后,软件生态逐渐成为影响使用效率的核心变量。

  大模型部署工程有很多复杂的流程。

  模型文件主要保存参数,本身无法直接在GPU上执行,需要接入推理引擎,由推理引擎调用底层驱动和算子,完成显存管理、任务调度、并行计算和Token生成。

  目前业内常用的推理引擎包括vLLM、SGLang和TensorRT-LLM。 华为升腾 还拥有MindIE等自有软件组件。不同引擎支持的模型架构、量化方式和芯片环境存在差异。一个新模型发布以后,换一款GPU运行,往往涉及代码修改、算子开发、参数调优和稳定性测试。

   英伟达 长期积累的优势也在这一领域。CUDA工具包已经覆盖编译器、运行库、调试工具和大量加速库。开发者拿到 英伟达 GPU,可以沿着一条成熟的软件路径完成开发。国产GPU厂商数量众多,各家的硬件架构、驱动和工具链各不相同,模型厂商很难在发布时兼顾所有芯片。

  GPUStack联合创始人、CTO梁胜将这种局面概括为“多对多”问题。

  “根本上需要解决多对多的问题,上面有多个模型,下面有多个GPU。”梁胜说。模型、芯片和推理引擎持续增加,组合数量随之扩大,依靠项目团队逐个适配,成本会越来越高。

  类似问题已经引起测评机构关注。2025年,中国信通院启动DeepSeek国产化适配测评,测试内容除了模型能否在国产软硬件系统上运行,还包括工具链易用性、适配成本、功能完备性和性能表现。

  GPUStack所做的工作,可以放在这一产业缺口中理解。

  这家公司2024年开源了同名AI基础设施平台,最初侧重GPU集群管理,现在把模型部署、推理引擎适配和Token服务放到了更重要的位置。

  GPUStack CEO秦小康在接受21世纪经济报道记者采访时表示,早期客户关注如何获得和管理GPU,如今更关心模型能否顺利部署。“过去大家获取硬件资源,现在要帮助用户把资源之上的模型真正跑好。”

  其解决方式,是在模型和GPU之间加入一个统一管理层。平台纳管不同厂商的GPU,根据模型和硬件环境选择推理后端,再通过统一API向上层应用提供服务。开发者面对相对一致的操作界面,底层可以使用 英伟达 、AMD或多款 国产芯片 。

  GPUStack公开代码库目前列出的硬件包括英伟达、AMD、 华为升腾 、海光、摩尔线程、 天数智芯 、沐曦、 寒武纪 和玄铁等产品,推理引擎支持vLLM、SGLang、TensorRT-LLM及自定义后端。

  GPUStack COO江鹏演示了如何将八张升腾910B、一张AMD MI300X和一张英伟达A100接入同一个集群,并把同一个模型的三个副本部署到三类硬件上。

  演示过程中还出现一段小插曲。推理后端版本选择有误导致了重新创建节点。这个细节恰恰说明了,异构算力管理的难点远不止“把几张卡放进同一张列表”。平台还要识别硬件环境,为模型匹配对应的推理引擎和软件版本。

  GPUStack团队此前长期从事 云计算 和容器管理。梁胜曾创办Kubernetes管理平台Rancher Labs,江鹏也曾任Rancher中国区CTO。他们将容器时代的管理思路带入GPU领域,用标准化平台屏蔽底层资源差异。

  这条路线也有明确边界。管理平台可以统一入口、自动调度和选择推理后端,但芯片厂商仍要完善驱动、算子库和 通信 系统,推理引擎社区还要持续适配新模型。

  江鹏在采访中表示,模型架构和硬件型号不同,性能优化效果差异很大。平台层的调度需要芯片厂商和开源社区配合,单一企业很难完成整条软件链的优化。

  软件栈受到重视,还与算力需求的变化有关。

  IDC与中国信通院的调研显示,按样本加权计算,目前企业约六成AI算力用于推理。英伟达2025年5月披露,其平台生成的推理Token数量在一年内增长了10倍。

  训练通常集中在少数模型公司和大型机构,但是推理需求非常广泛。代码助手、智能客服、企业智能体和 机器人 每完成一次任务,都要持续调用模型、消耗Token。用户数量和调用频率增长以后,同一批GPU能够处理多少并发请求,直接影响服务成本。

  “Token工厂”因此成为近期AI基础设施行业热门概念。它把智算中心的产出单位由算力参数变成Token。客户无需理解底层使用哪款GPU,最终购买的是稳定的模型调用服务。

  围绕这一目标,推理平台正在集中优化几个环节。资源池化可以把零散GPU统一调度;PD分离可以把提示词处理和逐字生成安排到更合适的计算资源上;KV Cache保存已经计算过的上下文,减少多轮对话和长文本任务中的重复计算;自动压测则用于寻找延迟、吞吐量与并发量之间的合适区间。

  阿里云等大型云厂商也在推进类似工作。阿里与北京大学团队在2025年公布的Aegaeon系统,通过多模型共享GPU和Token级动态调度,在特定生产测试中减少了GPU占用。

  GPUStack瞄准的是另一类客户:金融机构、政府部门、高校、制造企业和算力运营商。这类客户拥有本地GPU集群,又很难像互联网大厂一样长期维持庞大的基础设施团队。IDC调研显示,85.8%的受访企业选择外部算力服务与自建 数据中心 结合的混合架构。私有算力持续增加,对标准化推理平台的需求也会扩大。据GPUStack透露,其全球部署实例已超过11万。

  随着AI产业进一步走入深水区,国产算力接下来的竞争,将更多聚焦于模型适配速度、稳定运行率、单位Token成本和故障恢复能力。

(文章来源:21世纪经济报道)

主题:焦点|基金|异构调度成新焦点|美股