登录

高通携手合作伙伴基于第六代骁龙8超级至尊版移动平台端侧落地MoE模型,加速智能体AI体验规模化扩展


速读:阶跃30B-MoE模型是目前市面上最大的手机端侧模型,也是首个在第六代骁龙8超级至尊版移动平台上完成跑通和验证的MoE模型。
2026年09月23日 15:3

要点:

• 高通 技术公司携手 阶跃 、 无量火 与 江波龙 基于第六代骁龙® 8超级至尊版,率先将 阶跃 StepEdge-Omni 30B-MoE(混合专家)模型完整部署于端侧,打造具备全链路 智能体AI 能力的端侧智能体助手。

• 依托第六代 骁龙8超级至尊版 移动平台 的强大AI性能和架构升级,结合四方的协同优化,不仅实现了300亿参数MoE模型完整的端侧部署,还大幅优化了模型预填充和解码运行速率及内存需求,支持模型在智能手机平台上的高效稳定运行。

• 本次合作解决了大参数模型在端侧部署的关键行业痛点,让300亿参数量级模型具备在智能手机上规模部署的条件,将推动更加复杂的 智能体AI 体验落地智能手机,并利用端侧用户数据和平台能力实现更加个性化的智能体服务。

2026骁龙峰会期间, 高通 技术公司宣布携手 阶跃 、 无量火 与 江波龙 开展四方合作,基于第六代骁龙® 8超级至尊版 移动平台 ,将阶跃StepEdge-Omni 30B-MoE(混合专家)模型面向端侧进行深度适配与推理优化,成功打造具备自主服务和个性化能力的端侧智能体助手,并在峰会现场完成基于 高通 参考设计的现场演示,验证了复杂 智能体AI 工作流在智能手机上的高效部署与规模化扩展能力,进一步加速智能体AI体验走进更多终端和广大消费者。

与每次推理均需激活全部参数的Dense(稠密)模型相比,MoE模型仅按任务需要激活部分专家模块,在保持大模型容量与能力的同时,显著降低计算量和内存带宽需求。因此,MoE日益成为推动云端规模大模型向终端侧部署的重要技术路径之一,为更先进、更强大的智能体AI体验在智能手机、PC及其他终端落地提供了现实基础。

第六代 骁龙8超级至尊版 移动平台 搭载全新Qualcomm® Oryon™ CPU、下一代Qualcomm® Adreno™ GPU和重新设计的Qualcomm® Hexagon™ NPU,并配备LPDDR6内存与高速存储通道,引领打造面向未来的智能体AI体验。定制Qualcomm Oryon CPU峰值频率高达5GHz,并引入全新的可扩展缓存架构Qualcomm Oryon FlexCache,实现更加强大的智能体多任务处理和系统规划能力;Adreno GPU引入针对AI负载打造的Adreno Matrix Cores,并支持全新Adreno Neural Fusion特性,将AI和图形处理更加紧密结合;Hexagon NPU则面向智能体AI的Transformer工作负载引入全新的Element Accelerator,并将大容量共享内存扩容50%,实现端侧推理性能的进一步突破。

在此之上, 无量火 的自研Ember推理引擎与Ember Kernel端侧编排内核基于第六代 骁龙8超级至尊版 移动平台的强大AI性能基础和完整软件栈支持,以XCompute异构调度实现跨CPU/GPU/NPU的统一高性能编排,在不修改模型结构、不损失推理精度的前提下,使阶跃30B-MoE模型的运行内存需求相比行业常规方案降低超50%。基于 江波龙 提供的端侧AI存储解决方案,模型权重可从端侧闪存高效加载,通过存储与计算协同减少大模型对运行内存的持续占用,进一步提升模型加载和运行效率,成功打造端侧智能体助手,实现从邮件理解到行程规划、日历同步、航班酒店推荐、行程分享到邮件草拟的全链路自主办公,全程本地完成,无需云端调用。得益于NPU+GPU双引擎协同,模型预填充吞吐性能超过330 Token/s,对比仅使用NPU的通用推理方案提升超过30%,解码吞吐性能超过28 Token/s,并能保持持续稳定运行,且首个词元生成速率达到毫秒级,对比云端API调用快数倍至数十倍。

高通技术公司高级副总裁兼手机业务总经理Chris Patrick表示:“此次合作展现了硬件、软件、内存和AI模型等多个领域的技术进步,如何推动日益复杂的AI工作负载直接在移动终端上运行。通过与阶跃、无量火和江波龙合作,我们优化了阶跃30B-MoE模型在第六代骁龙8超级至尊版移动平台上的部署,在提升吞吐性能、降低内存需求的同时,实现了持续稳定的终端侧运行。这些成果将有助于推动更快速响应、更注重隐私保护的AI体验直接在智能手机上运行。”

阶跃副总裁、端侧模型负责人俞刚表示:"我们很高兴能与高通技术公司达成端侧模型合作。阶跃30B-MoE模型是目前市面上最大的手机端侧模型,也是首个在第六代骁龙8超级至尊版移动平台上完成跑通和验证的MoE模型。第六代骁龙8超级至尊版移动平台的强大端侧算力充分释放了阶跃30B-MoE模型的推理能力,为低时延、高隐私的端侧智能体应用拓展想象边界。"

无量火CEO王瑜琨表示:“我们很高兴与高通技术公司携手推进端侧MoE大模型落地。基于第六代骁龙8超级至尊版移动平台,无量火自研的Ember推理引擎将大模型内存需求降低超过50%,让手机即可流畅运行30B大型MoE模型。我们期待与高通技术公司及生态伙伴深化协作,让手机进化为真正懂你的个人智能终端,带来低延迟、高隐私的端侧AI体验。”

江波龙副总裁、嵌入式存储事业部总经理黄强表示:"端侧AI的规模化落地,离不开算力与存储的深度协同。江波龙将行业独有的iSA存储智能体,率先适配第六代骁龙8超级至尊版移动平台,通过存算协同释放平台算力价值,突破端侧大模型推理存储瓶颈。期待与高通技术公司持续深化生态协作,共同打造高性能端侧AI解决方案,为终端用户带来更稳定、可靠的本地AI体验。"

2026骁龙峰会将展示基于第六代骁龙8超级至尊版移动平台和阶跃30B-MoE模型的智能体办公体验,敬请期待。

主题:高通技术公司|阶跃30B-MoE模型|智能体AI体验|端侧智能体助手|将阶跃StepEdge-Omni30B-MoE