登录

刚刚,面壁智能2 B「小钢炮」登顶!Agent榜断层第一,连训练数据都开源了


速读:Agent榜断层第一,连训练数据都开源了2026年09月08日11:59市场资讯(来源:AI信息Gap)。 对开发者来说,模型权重只是冰山一角,训练数据和方法论才是最有价值的东西。 但面壁智能换了个思路,参数量保持不变,通过提高训练数据质量和优化训练方法,追求极致的参数效率,结果1个参数能抵得上2个的效果。 这是「大模型密度定律」最直观的体现。 大模型密度定律(DensingLawofLLMs):由面壁智能联合创始人、清华大学刘知远教授团队提出,核心结论:模型智能密度随时间呈指数级增强,达到特定智能水平所需参数量每3.5个月下降一半。
2026年09月08日 11:59

(来源:AI信息Gap)

2B 参数的小身板打赢 12B 模型,这在端侧模型里还是第一次。

刚刚,面壁智能「小钢炮」系列新成员  MiniCPM5-2B  正式开源。此前它曾在 WAIC 2026 亮相,但只是发布,这次是真·开源。

在知名权威 Artificial Analysis 模型排行榜上, MiniCPM5-2B  综合智能指数 23 分,排名第一,超过了 12B 的  Gemma 4 (22 分)和 9B 的  Qwen3.5 (22 分)。

Agent 能力榜 20 分,断层登顶,第二名只有 9 分。综合评测, MiniCPM5-2B  均分 53.9,同为 2B 参数的其他模型只有 24.6-33.2 分,甚至超过了 4B 级别的  Qwen3.5-4B (51.1 分)。

为什么前面我说  MiniCPM5-2B  是真·开源?

大部分开源默认只开放模型权重,面壁智能这次连训练 Recipe、SFT 数据、数据治理工具 UltraX 和 RL 训练框架 Meshy 都开源了。对开发者来说,模型权重只是冰山一角,训练数据和方法论才是最有价值的东西。截至 2026 年 8 月, MiniCPM  系列模型开源下载量已经突破 5000 万。

MiniCPM5-2B  首次在端侧实现了通用 Agent 能力雏形,在部分任务上的表现超越了  Qwen3.5  和  DeepSeek-R1 。一个 2B 的端侧小模型,能调用工具、深度搜索、生成代码,这在以前你敢想?

2B 的身板,12B 的智商

前面提到的 AA Intelligence Index 是 Artificial Analysis 推出的综合智能指数,它涵盖了 GDPval-AA、τ²-Banking、Terminal-Bench、SciCode 等 9 项基准评测。Agentic Index 衡量的是模型在 Agent 工作流里的表现,比如工具调用、任务规划、自主决策、复杂问题解决。

还有一个新出的 GDPval-AA v2 排行榜,用真实工作任务给模型评分,人类基线设定为 1000 分。在所有开源的端侧模型里, MiniCPM5-2B  得分 891,排名第一。第二名  Granite 4.2 8B ,702 分。接着是  Gemma 4 12B  647 分、 Qwen3.5 9B  645 分。

再来带你们看个更有意思的, 端侧模型斩杀线 。

这是一张「参数-智商」散点图,横坐标是模型参数量(取对数处理),纵坐标是模型智商,参数少但智商高的模型性价比最高。 MiniCPM5-2B  站到了最高点,达成「帕累托前沿」。

想要提升模型能力,大多数团队的第一反应是猛猛加参数,毕竟大力出奇迹。但面壁智能换了个思路, 参数量保持不变,通过提高训练数据质量和优化训练方法,追求极致的参数效率,结果 1 个参数能抵得上 2 个的效果 。这是「大模型密度定律」最直观的体现。所以你才能看到 2B 参数的  MiniCPM5-2B ,斩杀了 4B 的  Qwen3.5-4B 。

大模型密度定律(Densing Law of LLMs):由面壁智能联合创始人、清华大学刘知远教授团队提出,核心结论:模型智能密度随时间呈指数级增强,达到特定智能水平所需参数量每 3.5 个月下降一半。

这里附上  MiniCPM5-2B  的综合评测对比表。

编程、数学和智能体,这个小钢炮是认真的。代码推理 LiveCodeBench v6, MiniCPM5-2B  69.1 分,全场最高,同为 2B 的其他模型最高只有 42.9。数学竞赛 AIME 2025 和 2026, MiniCPM5-2B  86.5 分,依旧全场最高。一共 10 项智能体类评测, MiniCPM5-2B  拿下 7 项全场第一,4B 模型也算在内。

MiniCPM5-2B,为什么?

大模型的能力上限很大程度上取决于训练数据的质量。

以前做数据治理,基本就是一篇一篇地过滤。一篇文章,要么整篇留下,要么整篇扔掉。问题是很多文章有几段写得特别好,但也掺杂着几段灌水内容。整篇扔掉太浪费,整篇留下又会引入噪声。

面壁智能开发了一个名为 UltraX 的工具来解决这个问题。UltraX 本身是一个 0.6B 参数的小模型,专门干这一件事,「逐行审阅网页数据,然后对每一行做编辑决策。」这行内容有价值就保留,否则就删掉,信息不完整就补全缺失的上下文,质量差就替换成更好的表述。

逐行治理数据,效果如何?用 UltraX 处理过的数据训练模型,160 亿 token 的训练量就能超过以前 200 亿 token 的效果。1B 参数的模型平均性能提升超 2%,在 50 组「任务-语料」组合里拿下 34 个最佳结果。数据少 20%,反而训练出了更强的模型。

作为国内「源神」之一,面壁智能这次共开源了 4 个数据集。 UltraData-Code  覆盖 11 种编程语言,是从 GitHub 1.92 亿个仓库里一层层筛选出来的分级代码数据。 UltraData-SFT-Agent-2609  包含约 50 万条 Agent 训练样本,涵盖工具调用、搜索、代码执行、文档处理。 UltraData-RL-2609  收录了超 8 万条强化学习训练样本,经过可验证性过滤、标签校验和难度匹配三轮清洗。另外还有 UltraX 本身,此前已经开源,包含 100B tokens 精炼数据,发布后一度登顶 Hugging Face Datasets Trending 榜首。

加上这次的 4 个,面壁智能和 OpenBMB 开源社区共开源了超过 10 个大模型训练数据集,从 UltraChat(150 万条多轮对话,月均下载量破百万)到 Ultra-FineWeb(1T+ tokens,曾登顶 Hugging Face 热门榜第一),再到 Ultra-FineWeb-L3(600B tokens,目前最大的开源中文预训练合成数据集)。截至 2026 年 9 月,UltraData 系列总下载量已突破 266 万。

Agent 能力,从预训练抓起

相比面壁智能之前的 MiniCPM 系列模型, MiniCPM5-2B  最大的突破是实现了端侧通用 Agent 能力雏形。工具调用、深度搜索、代码生成,这些能力以前是大模型的专属,对于一个 2B 参数的端侧模型太过勉强。

那面壁智能怎么让  MiniCPM5-2B  学会干智能体的活儿?这背后是一套从预训练到对齐的完整训练流程优化。

Agentic 预训练 ,在模型预训练的时候就大规模注入 Agent 相关的训练数据,让模型从学习的起点就理解工具调用和任务规划是怎么一回事。这是刻在 DNA 里的能力。

Agent SFT ,用大量真实的 Agent 交互轨迹进行监督微调,教模型怎么执行工具调用、写代码、搜索。上面提到的  UltraData-SFT-Agent-2609  数据集里 50 万条样本就是干这个用的。

大规模 Agent RL ,用强化学习进一步对齐 Agent 行为,提升模型在复杂任务中自己规划、纠错的能力。训练数据就是  UltraData-RL-2609  里那 8 万多条经过三轮清洗的样本。

RL 训练本身也有讲究。面壁智能这次同时开源了自研的强化学习框架 Meshy 和训练策略  JustRL II 。

Meshy 干掉了传统 RL 训练里的中央控制器和 Ray 依赖,把训练、推理、奖励计算全部拆分成对等服务,同步、异步、全异步三种训练模式随时切换,扩展起来相当方便。 JustRL II  解决的是另一个问题,端侧模型做长思维链的强化学习,经常越训练分数越低,原因是训练数据噪声大,而且 GRPO 的信用分配太粗糙,面对上万个词元的推理链分不清哪步对哪步错。 JustRL II  的做法是数据上用三阶段流水线筛选校准,算法上给 GRPO 加了一个 Critic 模块,把信用分配的颗粒度提升到了词元级别。 MiniCPM5-2B  在 RL 阶段用的就是这套方案。

MiniCPM5-2B,实测一波

来,实测一波。

对会议速记这种充满口语和省略的输入, MiniCPM5-2B  的理解力超出了我对 2B 模型的预期。

随口的一句「首屏优化顺手做了,不单独立项」, MiniCPM5-2B  专门停下来分析了这句话的歧义,「做了」到底是做完了还是没做,「不单独立项」到底是取消了还是并入其他任务。最后它把这条需求归为了「并行推进,不单独立项」。

主题:模型|MiniCPM5-2B|12B|面壁智能