登录

小米杀入模型第一梯队


速读:小米杀入模型第一梯队小米杀入模型第一梯队_东方财富网。 ArtificialAnalysis最新数据显示,MiMo-V2.6-Pro的综合智能指数达到46分,超越KimiK3、通义千问Qwen3.8Max,目前排在开放权重模型第一。 模型训练本来是大模型公司最不愿意公开的部分,小米这次连训练中途出现的问题都一起放了出来。 9月17日凌晨,小米MiMo负责人罗福莉公布了MiMo-V2.6的强化学习进展,同时把正在进行的训练直接放到了网上直播。
小米杀入模型第一梯队 _ 东方财富网

小米杀入模型第一梯队

2026年09月23日 16:02

来源:

新财富

K图 01810_0

  9月17日凌晨,小米MiMo负责人罗福莉公布了MiMo-V2.6的强化学习进展,同时把正在进行的训练直接放到了网上直播。

  打开页面可以看到两条正在运行的训练线,分别对应MiMo-V2.6-Pro和Flash。训练进度、Token消耗、任务通过率和累计成本都在实时更新。模型训练本来是大模型公司最不愿意公开的部分,小米这次连训练中途出现的问题都一起放了出来。

  钱也确实烧得很快。最终不到6天时间,Flash和Pro分别花掉约85万美元和262万美元,合计347万美元,各自完成30步强化学习训练,累计产生约75万条任务轨迹。小米官方披露,训练结束后,两款模型的任务平均通过率分别提升约25%和12%,在没有直接参与训练的DeepSWE v1.1上也出现了明显提升。

图片 0 1

   小米又把开源模型往前推了一步

  Artificial Analysis最新数据显示,MiMo-V2.6-Pro的 综合 智能指数达到46分,超越 Kimi K3、通义千问 Qwen3.8 Max,目前排在开放权重模型第一。昨天刚刚发布的Grok 4.7同样是46分,而MiMo的实测输出速度达到每秒约130个Token。

图片   虽然还没有超过最顶级的闭源模型,尤其在Terminal Bench这类高难度Coding Agent测试里,GPT-6和Claude依然领先不少。但如果把模型放到更多实际任务里,差距已经不像过去那么大了。

  按照小米公布的测试结果,MiMo-V2.6-Pro在DeepSWE v1.1上达到71.9分,已经接近GPT-6 Astra、Claude Opus 5等头部模型;在Automation Bench、Toolathlon以及真实职业任务JobBench等测试中,也基本进入第一梯队。

图片   过去一年这种变化一直在发生。DeepSeek把推理模型的价格打下来, 智谱 持续强化Coding,Qwen在开源生态里扩大覆盖面,MiniMax也在长上下文和Agent上推进。MiMo V2.6又把这条线往前推了一段。

  而且它选择了一条很有意思的路线。MiMo-V2.6-Pro并没有重新换一个更大的基座,主要能力提升来自过去半年积累的中期训练和最近这轮大规模强化学习。

  罗福莉在发布后称,这次MiMo V2.6的研究创新和工程难度甚至超过了她此前参与的DeepSeek R1。

  小米想验证的事情可以理解为:一个已经很强的基础模型,能不能通过大量真实任务反复训练,让它越来越会自己完成工作。

  从公开结果来看,这条路暂时有效。

0 2

   直播训练比347万美元更重要

  大模型公司过去谈训练,经常只在模型发布以后告诉你用了多少张GPU、多少Token、训练了多久。至于模型在训练过程中怎么变化,外界基本看不到,MiMo这次直接把这个过程摆了出来。

  9月17日训练直播刚开始时,Pro和Flash仍然处于强化学习中间阶段。随后几天可以看到训练费用不断增加,任务成功率一点点提高,模型在一些外部测试里的成绩也同步上涨。 36氪 当时统计,小米每小时的训练开销已经超过20万元人民币。

  这种公开方式有很强的传播效果,但它也对应小米现在大模型路线上的一个变化。小米在4月份推出MiMo-V2.5之后,接近半年没有发布新的旗舰模型。罗福莉当时解释,这段时间团队主要在研究强化学习还能扩展到什么程度。与过去不断增加预训练参数相比,这一轮的重点明显放到了Agent,以及模型处理长时间、多步骤任务的能力上。

  这是今年整个大模型行业共同在做的事情。

  GPT-6 Astra最明显的升级之一就是长程任务和Coding Agent能力;Anthropic的Claude Code已经把Agent带进真实的 软件开发 工作流;Grok 4.7这次也专门强化了需要数小时才能完成的复杂任务。

  大模型的Scaling开始从预训练继续向强化学习延伸。如果在已有基座上增加后训练投入,能够持续换来Agent能力提升,那么模型公司的竞争方式还会发生变化。模型迭代未必每次都需要重新训练一个规模更大的基座,后训练本身可能成为非常重要的算力消耗方向。

0 3

   真正狠的是价格

  如果MiMo V2.6只是做到开放权重模型第一,这件事还没有那么大,它的价格更值得看。

  国内API中,MiMo-V2.6-Pro每百万Token普通输入3元、输出6元,缓存输入0.025元;Flash则进一步降到输入1元、输出2元,缓存输入0.02元。价格和上一代基本保持一致。小米官方按照自己的比较口径称,在相近智能水平下,MiMo V2.6的价格大约只有海外模型的1/20至1/60。

  Artificial Analysis使用海外API价格计算,MiMo-V2.6-Pro每百万Token输入0.435美元、输出0.87美元。同样拿到46分的Grok 4.7,输入和输出价格分别为2美元和6美元。

图片   当然,模型价格不能简单用每百万Token直接比较。更强的模型可能一次完成任务,弱一些的模型反复调用几轮以后,总成本未必更低。不同模型生成Token数量、工具调用方式和成功率也都有区别。

  但当两款模型的 综合 能力已经进入同一档,价格差距达到数倍甚至十几倍以后,开发者一定会重新算账。这也是“模型斩杀线”这个说法比较准确的地方。

  以前一个模型做到中上水平,即便比GPT或者Claude弱一些,只要价格便宜,就有自己的市场。随着MiMo、DeepSeek、Qwen、GLM这些国产模型继续提高能力,这个生存区间越来越窄。

  MiMo V2.6目前46分,同时具备100万Token上下文、原生多模态、开放权重和非常低的API价格。以后一个模型如果 综合 能力明显低于这个水平,商业上就需要有更低的成本、更特殊的场景或者更强的产品入口来支撑。

  另一边也一样。GPT-6 Astra、Claude仍然更强,但随着中间这一档模型的能力不断逼近,它们需要用更高的任务成功率、更少的返工次数和更完整的产品生态来支撑价格差距。这种压力已经传到了最头部的公司。

  GPT-6 Astra发布以后,Anthropic正在考虑IPO之前推出新的Claude模型。路透社报道,Astra推出后迅速获得企业用户采用,而Anthropic同时面临上市和盈利压力。

0 4

   大模型比车好像更“好做”

  MiMo-V2.6出来以后,大模型对小米来说,可能比 汽车 更“好做”。模型训练出来以后,AA多少分,Coding和Agent能力怎么样,和GPT、Claude还有多少差距,速度和价格处在什么水平,基本很快就能看出来。

  反观 汽车 ,一辆车从产品定义开始,要经过研发、供应链、生产制造、定价、发布、舆论、销售、交付和售后,无数环节都会影响最后结果。产品研发几年、工厂建好、供应商产能准备完成,真正上市之前,依然没人敢保证一定成功。

  SU7第一阶段已经证明 小米汽车 做成了。2026年二季度, 小米汽车 交付10.42万辆,同比增长28.2%,智能电动车收入239亿元。但 汽车 依然是一门很重的生意,工厂、渠道、新车型、研发都需要持续投入,同期智能汽车、AI及其他创新业务仍然亏损26亿元。卖得好,只是第一关。后面还有产能、交付、毛利率、新车型和长期品牌。

  2026年二季度,小米全球智能手机出货量3120万台,同比下降26.4%,市场份额从14.2%降到11.3%。全球前五大手机厂商中,小米当季出货量降幅最大。

  中国市场同样承压,小米二季度出货量同比下降21.7%,市场份额从15.1%降到12.4%。同期华为和 苹果 分别增长19.4%和24.4%。

  今年内存和其他核心零部件涨价,整个手机行业都不好过,但小米受到的影响确实更大。好的一面是高端化还在继续。二季度小米手机收入421亿元,下降幅度明显小于销量;手机平均售价达到1351元,同比增长25.9%,创 历史新高 。

  随着豆包手机的正式上市,未来旗舰手机之间的差距,会越来越多地来自背后的模型。Agent能不能真正操作App,能不能理解用户长期数据,能不能管理文件、调用系统能力,端侧和云端怎么协同,这些最后都会重新变成手机体验。

  所以MiMo对小米的价值,不一定只看API能赚多少钱。它可以进手机,可以进汽车,可以接入IoT,可以成为整个小米设备体系背后的智能底座。

  这一点也是小米和OpenAI、Anthropic最大的不同。

  OpenAI和Anthropic做模型,最后一定要通过订阅、API和企业客户把模型本身变现。

  小米手里已经有手机、汽车、家电和十亿级连接设备。哪怕MiMo本身收入不高,只要能把这些设备变得更好用,它就已经产生了价值。

  今年二季度,小米智能汽车、AI及其他创新业务收入249亿元,其中汽车收入239亿元,MiMo现在的商业体量还很小。

  把手机、汽车和大模型放在一起看,大模型反而是反馈最快的一条业务。手机已经进入存量竞争,汽车从产品定义到市场验证需要几年时间,模型好不好,发布以后很快就能看到结果。

  MiMo-V2.6已经证明,小米的大模型团队进入了全球第一梯队。接下来就看小米愿意在这条路上走多远。

  至少现在看来,大模型比车,好像真的更好做一点。

(文章来源:新财富)

主题:财经|新股|小米杀入模型第一梯队|基金|美股