登录

RLinf官方CI接入国产GPU:摩尔线程S 5000具身RL训练曲线对齐国际主流GPU


速读:
2026年09月23日 13:59

9月19日,由 摩尔线程 主办的“MUSA开源技术沙龙: RLinf × MUSA Meetup”在北京圆满落下帷幕。本次沙龙从系统框架、集群实测、真实案例到算法演进四个维度,全面复盘了MUSA与 RLinf 软硬协同攻坚具身“工程战”的实战答卷。

会上, RLinf 开源框架负责人、清华大学深圳国际研究生院助理教授于超透露,RLinf官方已正式支持MUSA后端运行,并上线相应部署文档;同时,官方CI自0.3版本起接入 摩尔线程 MTT S5000 ,所有代码commit在合入主分支前均须基于国产算力完成自动化验证。与此同时,双方正联合打造基于 国产GPU 的端云协同具身智能框架,云端采用MTT S5000 、端侧采用MTT E300,覆盖训练、推理、仿真与渲染全场景。

RLinf是首个面向具身智能的“仿训推一体化”大规模强化学习框架,由清华大学、无问芯穹联合发布,已于2025年9月开源,目标是打通渲染、训练、推理三个环节在系统层面的割裂,让开发者在统一平台上完成从仿真环境交互到策略梯度更新的完整闭环。

围绕这一目标,RLinf持续快速迭代,多项成果被NeurIPS、OSDI等顶级会议收录:M2Flow编程范式大幅降低了大规模RL系统的开发复杂度;Flow-Noise、Flow-SDE系列算法在四个主流测试集上带来30%~50%的性能提升;USER系统让开发者可以“像使用GPU一样使用机器人”;RL-Co实现了仿真与真机的联合训练。框架实验显示,RL后训练可使VLA模型的执行泛化能力提升超过30%。

谈及与 摩尔线程 的深度共建,于超表示, 渲染能力是关键考量:“摩尔线程是国内除国际主流GPU厂商之外,少数能在渲染环节提供成熟支持的算力伙伴。”此次官方CI的接入意味着国产算力与国产具身强化学习框架,已从单向“适配”进入双向“共建”阶段。

摩尔线程在会上公布了MTT S5000 承载前沿具身RL负载的实测结果。团队在RLinf框架上对WoVR负载完成全量适配与复现,采用GRPO算法rollout action,并使用WAN世界模型根据action想象执行结果,最后使用ResNet评估执行结果的对错并给出奖励用于GRPO训练,全程无需真实机器人参与即可完成RL后训练,跑通LIBERO的Spatial与Goal两个任务套件。据团队介绍,在248个并行环境、相同配方与随机种子的控制变量条件下,S5000与国际主流GPU的训练曲线高度吻合,在191步共同窗口内逐步相关系数r=0.976;真机LIBERO-Spatial评估中,两套硬件训练出的策略成功率对齐。

工程优化方面,摩尔线程团队对单步耗时逐相拆解后实施三项改造:图像处理从主机端迁移至GPU端;去噪循环的数值检查由每步5次合并为整轮一次;热路径上的Python标量替换为0维设备张量。改造后,整步耗时从2549秒降至1888秒(下降26%),env交互耗时降低14%,rollout出动作耗时降低20%,GPU空转率由18.5%压缩至3.1%;算子级基准测试显示,S5000的GEMM与注意力性能达到国际主流GPU的1.6-2倍。

团队同时披露了面向具身操作的4DGS高保真场景重建方案,可从操作台的多目视频端到端重建3D动态场景,为RL后训练与Sim2Real提供数据与评估支撑。

主题:摩尔线程