模型权重如何成为AI的下一个「训练语料」?
随着公开可用的高质量训练数据趋于饱和,Scaling Law 的边际收益正在递减。研究者们对此的回应包括合成数据的规模化生成、推理阶段计算资源的重分配,以及对已训练模型本身的二次利用等。在这一背景下,瑞士圣加仑大学 Damian Borth 教授提出了「权重空间学习」的框架,即将已完成训练的神经网络权重视为一种独立的数据模态,通过对权重空间的结构化学习,使模型能够从既有模型的集体经验中提取知识,而非每次都从原始数据重新开始。
目录
01. 当数据濒临枯竭,模型权重能否成为下一代「燃料」?
模型如何成为模型的训练数据?什么是权重空间学习? ...
02 . 权重空间学习如何实现用「模型」作为数据训练「模型」?
「用模型训模型」会遇到什么障碍?用模型权重训练的模型性能如何? ...
03 . 按需生成模型能否重构深度学习的生产范式?
数据集嵌入提示如何实现模型定制 ? 权重空间学习在哪些场景可替代部分预训练? ...
当数据濒临枯竭,模型权重能否成为下一代「燃料」?
1、瑞士圣加仑大学 AI 与机器学习教授 Damian Borth 近期接受采访,介绍了 Borth 团队近期的工作内容以及「权重空间学习」的技术范式,该范式可解决介绍高质量训练数据日益稀缺、预训练成本持续攀升的问题。
① Damian Borth 现任圣加仑大学任人工智能与机器学习全职教授,此前曾任德国人工智能研究中心(DFKI)深度学习竞争力中心主任,并在 UC Berkeley、国际计算机科学研究所(ICSI)从事博士后研究,博士毕业于凯撒斯劳滕工业大学。
② 其团队长期关注深度神经网络的表示学习,应用方向覆盖计算机视觉、遥感地球观测与金融时间序列,权重空间学习则是其中一条逐渐主线化的分支。
2、「权重空间学习」是由 Borth 及其团队自 2020 年探索、在 2021 年 NeurIPS 论文中正式系统化的研究方向。 该范式主张把训练完成的神经网络权重视作一种可被再次学习的数据模态,让模型不再只是训练的终点,也可以成为下一轮训练的原材料。
① 2020 年,Borth 团队在 「Investigation of the Weight Space」 论文中,提出神经网络的权重在训练过程中每一轮迭代都会发生微小偏移,导致局部层面缺乏稳定的参照点。[1-1]
3、在 2021 年,Borth 团队发表论文「Self-Supervised Representation Learning」 验证了「把神经网络权重作为可学习模态」的可行性。通过使用自编码器在微型网络上实现稳定压缩,潜向量可通过一个线性回归头预测模型准确率。[1-2]
① 该工作受到 Google Research 团队「Predicting Neural Network Accuracy from Weights」工作的启发。Borth 团队采用端到端的表示学习替代手工特征。他们设计了一个自编码器架构,将多个神经网络的权重序列编码至低维潜空间后再重构,以此验证权重之间是否存在可被学习的共享结构。[1-3]
② 团队在 600 个网络上训练,在另外 300 个网络上测试,预测结果与真实准确率之间的 R² 超过了此前基于手工特征的方法。
3、Borth 表示,随着更多研究者加入,领域开始建立共同语言和基准测试。首届权重空间学习研讨会于 2024 年举办,ICML 也设立了权重对称性相关的研讨会,形成了相关的社区。
① Haggai Maron 的团队在 2023 年发表论文「Equivariant Architectures for Learning in Deep Weight Spaces」,在权重空间等变架构上与 Borth 团队形成呼应,探索表示工程的可能性。[1-4]
② Anthropic 等机构在模型内部机制与可解释性方向上持续产出,虽未直接采用权重空间学习框架,但同属「将神经网络产物本身作为研究对象」的相邻前沿。如 2021 年发布的「Mathematical Framework for Transformer Circuits 」与 2022 年发布的「Toy Models of Superposition」等。[1-5][1-6]
权
1、自编码器在微型网络模型库中验证了权重空间存在可学习超表征,潜向量可预测模型准确率。Borth 团队随即于 2022 年尝试从潜空间中采样来生成神经网络,目标是从模型库中聚合知识生成新模型,而后三类障碍随之浮现,分别位于生成质量、空间几何与训练语料层面。. ..
关注👇🏻 「机器之心PRO会员」,前往「收件箱」查看完整解读