登录

35 B干赢万亿参数大模型!上交大AI开始给自己造题还能自我迭代了


速读:来自上海交通大学人工智能学院、深势科技和上海算法创新研究院的无尽前沿团队,最近给出的思路是让AI参与创建、筛选和迭代自己的训练任务,并由此发布科研大模型BigBang-V1。 但模型也不能只依靠现有数据持续扩张,随着高质量数据和有效任务被反复使用,继续增加投入所带来的边际收益也会逐渐下降。
2026年08月07日 17:05

AI 开始参与造 AI,下一步学什么成了新问题。

Ilya Sutskever 去年底指出,预训练数据终将耗尽,单纯把现有训练规模再放大 100 倍,很难带来根本性变化。经历数年的规模扩张后 ,AI 行业正在重新进入「研究时代」,下一次能力跃迁需要新的训练方法和学习机制。

视频来自:https://www.youtube.com/watch?v=aR20FWCCjAs

行业的注意力也开始转向研究流程本身 。昨天,在谷歌效力 27 年的技术元老 Jeff Dean 官宣离职,拉着 Sanjay Ghemawat、Quoc Le 和 Oriol Vinyals 三位老伙计共同创办 Discovery Loop。而这家公司干的,就是自动化科学与工程中的完整实验循环,让 AI 提出实验、完成实现、运行评估,再根据结果调整下一步方向。

那么问题来了,当模型越来越擅长解决问题,下一批真正有价值、足够困难的问题该由谁提出?这些问题的答案又该如何可靠验证?

来自上海交通大学人工智能学院、深势科技和上海算法创新研究院的无尽前沿团队,最近给出的思路是让 AI 参与创建、筛选和迭代自己的训练任务,并由此发布 科研大模型 BigBang-V1 。

模型:https://huggingface.co/endless-frontier/BigBang-v1

项目主页:https://endlessfrontier.tech/

论文标题:BigBang: Pursuing Open-Ended Intelligence through Self-Evolving Synthesis of Verifiable Frontier Tasks

完整技术报告:https://endlessfrontier.tech/

BigBang-V1 基于 Qwen3.6-35B-A3B 进行后训练,在后训练阶段使用了完全由 AI 合成的数据。实验结果显示,在所选 35B 规模模型中,BigBang-V1 在 10 项评测上取得最高已报告分数,并在若干高难度任务上达到或超过部分更大规模的前沿模型。

BigBang-V1 与代表性闭源、开源前沿模型及 35B 参数规模模型在长程搜索、编程、科学研究和 AI 研究基准上的对比。“-” 表示相关分数尚未公开或未经测试。

又一次「小模型挑战大模型」的叙事?并非如此,BigBang-V1 的真正亮点是它背后的数据生产方式。

在传统流程中,人类专家确定方向、设计问题、准备答案并检查结果,模型负责学习已经整理好的数据。BigBang 则试图把其中更多工作交给 AI,它不仅生成问题和答案,还参与修改数据生产程序、调用工具完成任务、检查候选结果,并根据数据是否切实提升了模型能力调整下一轮合成策略。

过去,AI 主要是被出题、被训练、被考试,BigBang-V1 则让 AI 开始参与决定 下一代模型应该学习什么 。

模型越来越强,人类开始出不动题了

Scaling Law 大家已经耳熟能详,增加参数、投入更多算力、收集更多数据,模型能力通常也会随规模增长而提升。

过去几轮模型能力的跃迁,几乎都可以从参数、算力和数据的扩张中找到解释。久而久之,「更大」也就成了「更强」的同义词。

但模型也不能只依靠现有数据持续扩张,随着高质量数据和有效任务被反复使用,继续增加投入所带来的边际收益也会逐渐下降。

尤其当模型开始接近人类专家在部分任务上的水平, 下一批真正能让模型继续进步的训练任务,要从哪里来 ?

这和「互联网上还有多少文本」并不是一回事。

网上的数据当然还有很多,但具备训练价值的新任务未必充足。模型已经反复见过的知识,再学十遍也难以扩展能力边界。真正困难的是,如何持续提出模型还不会、又值得学习的问题。

这类问题通常需要专业研究人员来设计、求解和验证。GPU 可以采购,专家时间却很难按卡扩容。大模型几天就能消耗掉海量数据,人类专家却无法突然进入倍速模式。哪怕一天喝三杯咖啡,也很难跟上计算集群的数据胃口。

更准确地说,模型缺的不只是题,而是「题目加反馈」。

一道题足够难却无法判断答案对错,很难形成稳定的训练信号;一道题容易验证却低于模型当前能力水平,训练价值同样有限。

真正适合持续训练的任务,需要同时满足两个条件: 足够前沿,也能够验证 。前沿性决定模型能否学到新东西,可验证性决定它学到的是不是对的。

BigBang 把 科学研究 选作了这两个条件的交汇点。

科学会不断产生新问题,同时提供形式化证明、程序执行、数值计算、模拟器、数据库、实验反馈和领域规则等多种验证手段。模型的答案可以直接放进工具里跑一遍,不必只靠另一个模型来评判。

更重要的是,解决一个完整的科学问题,往往需要搜索资料、判断证据、提出假设、编写代码、调用工具、分析结果,并在失败后调整路线。科学因此成为训练通用问题解决能力的综合课程。

但模型能力会不断变化,固定题库迟早会过期。上一轮还很困难的问题,训练之后可能迅速变成送分题。BigBang 真正要解决的,不只是「如何生成更多科学数据」,还得是 如何让训练任务的生产系统,随着模型能力一起变化 。

BigBang 如何让「造题程序」自己进化?

BigBang 的技术框架包含内外两层循环。 内层持续改进合成数据,外层验证这些数据 能否真正 提升模型 。

内层循环 由 Generator Agent 和 Critic Agent 组成。前者持续生成并求解候选任务,后者负责对抗式审查。通过审查的样本进入训练数据池,存在缺陷的样本会被修改或淘汰。Critic 给出的反馈还会影响下一轮生成策略。

主题:模型|BigBang-V1|问题