MiniMax违背「祖训」,企业收入暴涨700%,偷偷变成了「卖铲子」的
在很多人的印象里,谈及 MiniMax,首先浮现的或许依然是曾经风靡海外的 AI 伴侣 Talkie,抑或是国内用户熟知的星野与海螺 AI。在过去很长一段时间内,这家大模型独角兽常被外界贴上「C 端公司」的标签。
情况在过去的一年里已然发生翻天的变化。
在 MiniMax 最新发布的 2026 年中期财报显示,相比一年前消费端约 70% 远远领先企业端约 30%的情况,其营收结构已经彻底倒挂,呈现出 B 端占据绝对统治的情况。
MiniMax 用了一年时间进行结构性迁徙,目前已经成为了一家以全球开发者生态、多模态 MaaS 与 Agent 基础设施为核心驱动力的算力底座公司。
根据已经披露的数据,MiniMax 的整体收入规模获得巨大提升,2026 年上半年实现总收入约 1.2 亿美元,同比增长 283.1%,仅半年的收入就达到了 2025 年全年收入的 1.5 倍。
这其中,以开放平台及其他企业服务为主的 B 端业务收入高达 7390 万美元,同比暴增超 700%,占总收入的比重从去年同期的 30.3% 飙升至 63.4%,一举跃升为公司最大收入支柱。
狂飙的企业级市场增长,为 MiniMax 的 ARR(年度经常性收入)带来显著增幅,截至 8 月达到了 8 亿美元,其中To B 业务占比已高达约 80%,To C 仅占约 20%。
(需要注意的是 ARR 并非一个公认会计准则的审计数字,存在天然的水分,但对于 AI 模型公司、SaaS 类公司仍是一个有价值的考量指标。)
另外,MiniMax 上半年海外市场贡献了约六成收入,其全球化底色再一次被凸显。
在收入暴涨的同时,销售及分销开支同比下降了 17.9% 至 2700 万美元,毛利则同比增长 464.8% 至 2081 万美元。
亏损方面,本期净亏损从上年同期约 4 亿美元降低到了 3.6 亿美元左右。
这意味着,MiniMax 彻底告别了依靠早期泛娱乐 C 端应用买量获客的早期阶段,在全面发力基础模型以及多模态模型能力之后,已经转向由企业和开发者生态驱动的自然网络增长。
再做一个简单的横向对比:
根据 The Information 报道,DeepSeek 今年前七个月里实现 7070 万美元收入,去掉热闹的七月的话,毛估 MiniMax 上半年营收是 DeepSeek 约两倍上下;
虽然 DeepSeek 的营收净值低于 MiniMax,但前七个月实现了 2025 年 10 倍的全年收入,增幅远高于 MiniMax;
DeepSeek 的前七个月净亏损为 1.06 亿美元,MiniMax 本期净亏损是 DeepSeek 的约 3.4 倍。
新老共识
MiniMax 透露,Token 消耗量的断层式拉升是本期收入暴增的重要原因。
仅今年 7 月,MiniMax 全平台的 Token 消耗量就达到了 1 月份的整整 20 倍。 截至目前,其全球企业客户与开发者数量突破 200 万,是 2025 年底的 10 倍之多。
Token 消耗出现如此夸张的非线性跃迁,答案在于模型消费范式的迁移。
CEO 闫俊杰透露,模型消费的范式已经从「人与 AI 的直接对话」,全面跃迁至「Agent 与 AI 的多轮级联交互」。
由 Agent 驱动的推理需求增长,显著快于人类用户数和消息数的增长。这直接导致单用户的 Token 消耗呈倍数级爆发。
这在日新月异的模型行业已经是「老共识」。
而更重要的新共识,则是后训练成为 Scaling 的新上限。
从近期智谱 GLM 5.3、DeepSeek V4 Flash(0731 版本)、Gemini 3.x Flash 的公开资料来看,越来越多模型厂商在小版本更新中重度依赖,甚至仅靠后训练,就能够显著提高模型在特定主流任务上的表现。
闫俊杰也在业绩会中提出这一新的行业共识的转变:当前大模型的 Scaling 正在从单一的预训练,快速拓展至中训练、后训练以及强化学习。
在后训练阶段,海量的合成数据生成、强化学习中的环境 rollout(推理/生成)、产成任务的试错验证,其本质都是推理计算。而单位算力下的推理成本越低、吞吐越大,模型在后训练中能够吞吐的轨迹与实验规模就越大。这也是为什么包括 MiniMax 在内的一众模型厂商,在中训练和后训练阶段投入的算力占比越来越高。
闫俊杰指出,在相同的算力规模下,推理计算效率的提升倍数,跟后训练的规模变大倍数呈现基本线性相关。这句话可以粗略理解为:后训练使得劲越大,推理的效率提升越多,模型呈现出的最终效果越好。
换言之,无论人们认为 Scaling Law 是否已经撞墙、模型参数量是否已经卷到了极限——后训练的效率提升仍然可以提高 Scaling 的上限。
新模型:M3 Pro、M3.1
MiniMax 透露正在稳步推进三个新模型的研发:M3 Pro、M3.1 和 H3.1。
其中,M3.1 的定位是面向主流用户,可以被大量、广泛使用的新「标准版」模型。M3.1 在 M3 基础上进行充分的预训练,并持续 Scaling 后训练规模。 其主要提升方向在于提升任务完成质量、推理效率、稳定性、插入到多种 Agent 产品中作为基模调用时的适配性。
M3 Pro 则是一个更加全面能力升级的模型,参数规模在 3 万亿左右。它的基座会是一个更大的基础模型,目标是更强的泛化能力和更高的智能上限。 M3 Pro 会采用 MiniMax 自主研发的新注意力架构 MSA 的第二代 MSA 2.0,能够显著提高推理阶段缓存命中率,从而提高整体算力利用率。
在稳步推进这两个基座模型的同时,MiniMax 目标是在 M3.1 推出时,将其推理成本降至 M3 初期上线时的三分之一左右。闫俊杰指出,推理成本的下降有两个好处,一是通过降价来降低使用门槛,从而扩大用户基数和 Token 用量,二是用于改善公司毛利率。闫俊杰认为这两者并非不可兼得。
除了语言模型,MiniMax 另一张王牌是多模态。
前不久 MiniMax 发布了多模态模型 MiniMax H3,并继续坚决采取开源策略。仅三周后,H3 的全球下载量已突破 2400 万次,衍生出超过 300 个公开模型,成为 2026 年全球最火爆的模型之一。
H3 是时隔多年以后,首次有开源多模态模型在生成效果和工具链适配上达到或接近于前沿闭源模型。其核心并非单纯的扩散生成,而是将语言模型深度嵌入视觉生成流中,实现了全局的上下文感知、多主体的一致性控制、镜头精细化调度等面向视频专业用户友好的效果。
闫俊杰认为,H3 的开源能证明了两件事情:语言模型能力可以进一步提高视觉生成模型的上限;开放权重模型、产品和 API 可以行程相互促进的生态,而非彼此蚕食。而长期来看,类似语言模型+视觉生成模型相结合的范式,在其他更加前沿的领域可能会持续涌现。
MiniMax 的公司名称令人想起 Min-Max 这一多功能术语。套用在模型实验室的身上,则体现该公司「最小化单位智能成本才能实现最大化智能水平」的认知,也即尽可能降低单位智能的供应成本,从而让让更高水平的智能更加广泛地进入人们的生产生活。
这一认知的直接体现,就是 MiniMax 今年上半年在后训练阶段持续发力,以更低成本实现模型能力预期提升的做法,而这一做法又直接带来了两大相互关联的重要变化:模型能力被更加注重性价比的企业端市场重视,以及公司营收显著增长。
事实上,这一认知已然成为行业的新共识,从这一点上看 MiniMax 也并没有多么特立独行。
APPSO 一直认为大模型行业将不可避免进入价格战阶段,而那些率先押注单位成本的模型厂商,将比盲目追求大参数、大智能的对手们领先一筹。