绕开黄仁勋国产算力甩出两副王炸:芯模秀恩爱Token价再降十倍
绕开黄仁勋 国产算力甩出两副王炸:芯模秀恩爱 Token价再降十倍
2026年08月13日 07:17
作为“词元(Token)炼化厂”的AI原生基础设施公司无问芯穹,去年底到今年7月,其智能体化“模型即服务”平台Agentic MaaS的日均Token调用量增长超40倍,其中超95%的增量需求来自智能体。
业内共识是:智能体应用爆发带来的推理算力需求,将是训练算力的十倍乃至百倍。与此同时,宏观层面,我国智算领域自立自强的决心不变。在智能算力占全国比重高达8%的上海,到明年自主可控智算比例要超过70%。
产业与政策层面两股推力下,国产大模型上下游结束单打独斗“草莽时代”,前所未有地拥抱共融生态,并祭出两大利器。
芯模协同,在CUDA生态壁垒撕开口子
第一大利器,在于芯模协同。
今年4月,与DeepSeek V4预览版上线几乎同时,华为宣布其昇腾超节点(一种将大量 AI芯片 紧密耦合为逻辑统一的庞大算力池)全系列产品支持V4。这意味着,早在V4研发时,华为芯片就已介入,与模型同步优化,而非过去模型设计只能围绕既有芯片的硬件特性“削足适履”。
芯模双向奔赴并非孤例。今年4月及7月,腾讯分别发布混元语言模型Hy3预览版及正式版。国产 AI芯片 企业燧原科技创始人、总经理张亚林,日前与腾讯混元大模型推理负责人朱健琛共同亮相2026世界 人工智能 大会,秀出了芯模恩爱。
张亚林确认,Hy3设计阶段,燧原与腾讯同步投入研发人员、算力资源,开展联合优化,实现底层软硬件双向同步迭代。腾讯朱健琛也透露,混元大模型团队会基于 AI芯片 的各项性能指标,反向设计MoE(混合专家模型)、Attention(注意力机制)等结构和参数,同步启动推理优化与工程适配,从软件栈、算子库开始,与芯片厂商一起做严格的精度对齐。
燧原与腾讯“混元”芯模协同
芯模协同的含金量之一,在于系统级的性价比。据公开信息,腾讯Hy3在性能出众前提下,输入百万Tokens的成本仅1元,输出为4元。
但国芯国模间的协同,绝非简单的供需对接,而是在国际芯片厂商的生态壁垒中撕开一道口子——
英伟达 的强大,从来不只在一块图形处理器(GPU),而在于CUDA生态。CUDA即Compute Unified Device Architecture(计算统一设备架构),这是 英伟达 构建的软硬件一体化计算平台,把芯片、编译器、算子库、框架接口和开发者习惯等绑成一整套体系,一旦在这套体系中完成训练部署,后续每一次迁移都会面临代码重写、算子补齐、框架重新适配和性能回退等连锁成本。
由此可见,芯模协同是国产算力产业摆脱外部依赖的关键一步。燧原科技创始人、董事长赵立东日前受访时说,燧原科技的目标,是与国内头部大模型厂商打通芯片、超节点服务器、集群互联、大模型全链路端到端适配,构建从底层硬件到上层应用的完整技术闭环,“芯模协同关系越深,国产算力的生态粘性就越强,也就越能走出一条自主的技术路线”。
算力精调,让每一度电炼出更多Token
算力精调是第二大利器。
当下,AI产业正从“拼单卡算力”转向“算单位Token成本”。如何将异质、碎片、跨域的算力资源高效聚合协同,从每度电、每秒芯片里榨出更多Token,成为AI基础设施企业的命门。
无问芯穹的核心技术锚点之一,就在于专炼Token,串联 电力 、模型、算力,目前已通过技术触达16种异构芯片(其中多数为国产芯)、3.7万P(每秒千万亿次浮点运算)算力,在服务Kimi、 智谱 、Minimax、阶跃星辰等头部厂商过程中淬炼出多重硬核功夫。
如异构调度。无问芯穹已在全球首次实现针对6种国内外不同芯片的混合训练,并将算力利用率推高至97%以上。
又如公私混训。针对客户“本地算力不足、云上资源闲置”痛点,无问芯穹实现了本地私有集群与公有云算力的安全互通混训,整体性能拉升68%。
再如千里协同。无问芯穹联合 中国电信 ,在新疆哈密—深圳两个算力集群间,成功验证了跨越4000公里的超远距离跨域集群协同训练的可行性。
无问芯穹CEO夏立雪日前在接受记者采访时透露,炼出高性价比Token的秘籍之一,在于公司首创的跨集群异构PD分离架构(Prefill-RelayDecode-MainDecode,PDD),其中P指Prefill(预填充),D指Decode(解码)。该架构用高效的以太网,将各地独立建设的异构算力集群连接起来,让擅长不同类型任务的不同集群内的算力资源分别做P和D,一起协同完成推理。这相当于让“偏科”的硬件只刷自己最擅长的题,既杜绝杀鸡用牛刀,也避免小马拉大车。在此之上,无问芯穹又进一步将传统的PD分离链路创新解构为三级分离式推理架构,解决实际落地时的传输延迟卡点,提升用户端体验,又最大化释放全域异构算力的产业应用价值。
近一年,无问芯穹已将Token成本削减10倍。未来夏立雪依旧有信心,通过技术再优化,推理成本还能再降10倍。
种种迹象表明,国产算力集群,正从“可用”,迈向“好用+盈利”。商汤科技联合创始人、大装置事业群总裁杨帆近期透露,截至7月底,商汤AI基础设施“商汤大装置”的日均Token调用量已达2.4万亿,若年底达成日均10万亿Token调用量目标,今年全年大装置的服务规模将实现25倍增长。但这些数据背后还有更令人兴奋的指标——大装置已实现20%以上的正向毛利率。这意味着,国产算力集群通过跨越软硬件的深度优化与生态协同,已实打实地把芯片利用率拉上去,从而覆盖掉硬件折旧、 电力 、机房、运维等直接成本。
也由此,国产算力供应链体系俨然出现一个关键时间窗口。商汤大装置顺势推出自动化迁移工具,支持用户从 英伟达 生态近乎零成本地平滑迁移至 国产芯片 体系,更在近期发起国产AI基础设施生态共建“银河计划”,有 寒武纪 、沐曦股份等芯片厂商,以及曦智科技、基流科技等光算力和算力调度层的近20家生态伙伴加入,目标是共建5个万卡级国产智算集群,赋能200家AI初创组织,围绕10个核心技术方向开展联合创新等。
这一次,国产生态伙伴们凑一起,不仅要炼出更便宜的Token,更致力于长出与英伟达平行的独立生态。
今年1月,英伟达CEO黄仁勋来华,首站落地上海,中国国产算力的进展一定是他的重点关注之一。2025年,黄仁勋在接受央视采访时,对华为等中国芯片企业不吝赞扬。他说:“从人员规模和技术能力来看,他们(华为)既广又深……我认为中国的AI市场无论有没有英伟达,都会进步。”
而今看来,国产算力甩出的两副王炸及背后代表的进步,的确被黄仁勋预判到了。
(文章来源:上观新闻)