MiMo-V2.6
分类
MiMo-V2.6
根据罗福莉分享的实时训练页面显示,目前小米旗下的最新大模型MiMo-V2.6正在进行大规模的Agent(智能体)强化学习(RL)实验。
文章
-Pro
截至17日下午界面新闻发稿,两个版本累计训练成本超过135万美元,其中MiMo-V2.6-Pro时长为1天21个小时,耗费超93万美元,平均每小时耗费超2万美元;
文章
训练页面包含MiMo-V2.6-Pro、MiMo-V2.6-Flash两个版本,具体展示了模型训练进度、Token消耗、训练成本、样本数量以及多个内部指标变化。
文章
事件
2026-09-17
9月17日凌晨,小米MiMo大模型团队负责人、前DeepSeek研究员罗福莉在X平台发文, 首次 公开旗下 最新 大模型MiMo-V2.6的强化学习(RL)训练进展,并同步上线实时训练页面,开启大模型RL阶段的全程公开直播
文章