国产GPU+类脑异构混合推理系统于2026中国算力大会全球首发
9月11-13日,2026中国算力大会于河北廊坊举办。由中移(苏州)软件技术有限公司联合中国电子科技南湖研究院、北京灵汐科技有限公司、上海天数智芯半导体股份有限公司、中国移动通信集团江苏有限公司、清华大学、北京大学共同研发的 基于国产GPU+类脑芯片的大模型异构混合推理系统 ,在本届大会“算力首创首发发布会”完成全球首次公开亮相。该成果是清华大学孵化的灵汐科技在云侧大模型极致推理方向的重要落地实践,利用我国在类脑芯片方面的优势为智能体时代大模型推理提供国产化异构全新解决方案。
当前,AI智能体、长上下文大模型、文生视频等业务快速普及,Token生成规模持续暴涨。传统纯GPU推理集群长期受“内存墙”“调度抖动”约束,在长上下文推理场景下,面临首Token延迟高、算力利用率不足、功耗与部署成本居高不下等现实痛点,难以满足智能体时代高并发、低时延推理的规模化落地需求。面向国产算力自主可控的时代要求,项目团队探索架构创新, 融合国产通用GPU与灵汐科技类脑芯片各自技术优势 ,利用我国在类脑计算芯片的优势在相对落后工艺基础上打造 国内对标国外主流GPU下一代国际先进的Vera Rubin with Groq异构推理方案的国产化系统。
该异构混合推理系统将基于Transformer结构的大模型进行PD+A拆分,创新性的将不同模块有序的部署在GPU+类脑异构算力系统。其中,Prefill阶段及Attention 计算模块交由国产GPU承载 ,FFN(MOE专家) 延时敏感模块交由类脑芯片处理 ,通过自研模型编译器、高速互联协议与统一异构推理引擎,实现两类算力的任务拆解、协同调度、结果聚合,充分发挥类脑芯片存算一体、片上大容量SRAM的架构优势,突破传统GPU推理的固有瓶颈。
数据显示(3台天数较早型号的GPU服务器+3台类脑机柜),运行Deepseek V4 Flash模型,相较同等投入规模的纯GPU集群,推理输出和推理能效均提升1倍以上。业务运营成本下降40%以上。同时,还可持续提升国产GPU集群在长文本输入下的推理输出性能。成果适配 Token工厂、AI代码生成、多智能体协同、智能制造 等高实时性场景,同时面向 金融、安防、通信等安全敏感行业,提供全栈国产化推理底座 。
项目拥有完整自主知识产权,累计形成15项授权发明专利、6项软件著作权,覆盖异构调度、类脑芯片架构、编译工具链、集群资源管理等全栈关键环节,技术目前已达到小批量试产阶段。整套方案 不依赖海外高端芯片与先进制程,依靠系统架构创新实现与国际顶尖异构推理架构对标的能力 ,为我国大模型推理算力自主可控提供重要实践样本。在本次中国算力大会上,该成果入选“算力首创首发”成果名录,面向产业客户、科研机构、投资机构完成首次公开展示。
首发发布环节外,灵汐科技团队、中移(苏州)软件技术有限公司、中国电子科技南湖研究院、上海天数智芯半导体股份有限公司将在大会期间开展技术交流与产业对接,倾听行业真实业务诉求。依托天数智芯国产通用GPU成熟工程化能力,配合灵汐类脑芯片存算一体、片上SRAM的架构优势,突破异构芯片流水线调度优化、跨架构高速协同联动等核心技术难题,全面拓宽高并发、低时延大模型业务的承载上限,树立了国产异构算力融合联调的行业标杆。后续灵汐科技将联合各合作方持续迭代这套异构混合推理方案,扩大主流大模型适配范围,推进在智算中心、行业算力平台的试点落地,把类脑架构的技术优势转化为规模化提升国产大模型推理能力的双引擎发动机。
主题:灵汐科技