登录

告别「小道消息」与研发黑盒!上海AI实验室探索「全开放预训练」开源模式


速读:这一次,上海人工智能实验室(以下简称:上海AI实验室)不仅开源模型参数,更将大模型研发的「黑盒」打开。 过去几年,大模型架构快速演进,新方法层出不穷。 大模型研发,不应是一个只展示结果、隐藏过程的「黑箱」。 在大语言模型(LLM)狂飙突进的今天,另一个不容忽视的现实是:最前沿的研发进展,正日益集中于掌握巨量计算资源的科技巨头手中。 一项看似有效的创新,适用于多大规模的模型,经过完整训练流程后能否保持效果,带来的是实际收益还是额外成本,常常缺少公开、可验证的实验结果作为支撑。
2026年07月29日 13:4

机器之心发布

这一次,上海人工智能实验室(以下简称:上海 AI 实验室)不仅开源模型参数,更将大模型研发的「黑盒」打开。全量 Checkpoints、训练日志、内部架构采纳与取舍全过程实验全面公开。基模架构探索平台 ArchSpace 正式亮相,开启大模型开源全新阶段!当前,「下一个概念预测」模型(NCP)、深度注意力模型(Depth-Attention)等十余种架构创新提案正在开放验证。

告别「小道消息」:为什么我们需要一场开源范式革命?

过去几年,大模型架构快速演进,新方法层出不穷。但哪些尝试真正有效,哪些最终被放弃,又是基于什么作出取舍,外界往往无从得知。对于 LLM 架构创新的工作来说,如果说有比一个新想法更重要的,那可能会是公开、完整的验证过程,以及对成功和失败经验的如实记录。

在大语言模型(LLM)狂飙突进的今天,另一个不容忽视的现实是: 最前沿的研发进展,正日益集中于掌握巨量计算资源的科技巨头手中。

科技巨头的研发节奏极快,而传统学术界从实验、论文撰写到投稿、审稿、发表的漫长周期,在以天为单位的产业迭代面前显得捉襟见肘。

由此出现了一个颇为尴尬的现象: AI 领域最前沿的技术细节与研发经验,越来越多地依靠私下交流、业内传闻乃至「小道消息」传播。 无论学术界还是工业界,都缺乏一个公开、规范、记录可靠,并能让实验结果完整回溯的公共创新平台。

尤其在基础模型架构创新中,这一问题尤为突出。每一代开源基模发布,往往带来新的架构设计,但这些设计背后的探索过程 —— 哪些方案经过验证,哪些尝试最终失败,又为何做出取舍 —— 很少被完整公开。一项看似有效的创新,适用于多大规模的模型,经过完整训练流程后能否保持效果,带来的是实际收益还是额外成本,常常缺少公开、可验证的实验结果作为支撑。

大模型研发,不应是一个只展示结果、隐藏过程的「黑箱」。为此, 上海 AI 实验室书生团队宣布将采用一种新的开发与开源模式: 不仅开放最终的模型参数,也将逐步公开预训练过程中的实验记录、架构取舍和验证结果,推动大模型预训练从「结果开源」走向「过程开放」。

ArchSpace 架构创新开放验证可视化官网 ArchSpace 架构创新开放验证可视化官网 官方可视化网站:https://www.archspace.live

GitHub 代码仓库:https://github.com/InternLM/archspace(代码沿革与实验记录持续更新中)

Weights & Biases(W&B)日志记录平台:https://wandb.ai/archspace

Huggingface 模型权重集合平台:https://huggingface.co/ArchSpace-Collection

不仅开源最终参数,更开源研发生命线!

放眼国内外的大模型开源实践,所谓「开源」大多仍止于结果层面:发布最终模型权重,或提供一份技术报告,至于研发过程中的试错经验、架构权衡与失败实验,外界通常难以了解。

书生团队认为: 真正的开放,不仅是共享「终点」,更是共享探索的每一个脚印。

在书生团队看来,开源不应只交付最终结果,也应尽可能公开结果产生的过程。上海 AI 实验室表示,此次将逐步开放大模型研发与训练的各个环节,具体包括:

开源模型全量 Checkpoints 与完整训练记录: 真实还原模型从零到一的成长轨迹;

开源探索性小规模实验过程与结论: 公开内部迭代中所有单点架构创新的尝试;

开源架构选型与取舍逻辑: 为什么选择这个方案?为什么放弃那个架构?让每一次研发决策的实验数据与依据都可被追溯;

开源完整验证流程: 社区提出的架构创新,将在统一流程下接受预训练、指令微调、强化学习的完整检验,而不只停留在局部实验或单一指标上。

ArchSpace 平台上线:直观可视化架构演进

为了将这种「全开放」模式落到实处,上海人工智能实验室将重点聚焦于基础模型架构(Foundation Model Architecture)的创新,涵盖但不限于:

层间 Attention(Inter-layer Attention)

隐空间模型(Latent Space Models)

长上下文稀疏 Attention(Sparse Attention for Long Context)

同时,正式推出配套的开源可视化平台 ArchSpace。

在 ArchSpace 上,上海 AI 实验室将 以一个经典的 Decoder-only Transformer 为起点,全面可视化从该起点出发的所有后续单点架构创新及迭代过程。

以一个新的 Attention 方案为例,用户可以在网站上清晰看到:

实验室是如何一步步从小规模实验开始放大的;

每一阶段的具体实验数据与对比结果;

下一步验证的模型尺寸与关键指标;

最终是否合并进入研发主线的决策原因。

每一个创新点,都有据可查;每一次成功或失败,都完全可回溯。

主题:开源|告别「小道消息」