科学家提出基于无约束噪声生成模型数据集蒸馏算法
作者:江庆龄 来源:中国科学报 发布时间:2026/10/11 19:40:59
科学家提出基于无约束噪声生成模型数据集蒸馏算法
华东理工大学教授陈志华、讲师戴蕾团队联合上海交通大学教授盛斌团队,通过引入自适应因子与扩展极小极大损失,并结合二次蒸馏,提出了基于无约束噪声生成模型的数据集蒸馏算法,为基于生成模型进行数据集蒸馏提供了新思路,为推动绿色人工智能与实现低功耗模型训练具有重要研究意义。相关研究成果发表于《IEEE模式分析与机器智能汇刊》。
数据集蒸馏通过将原始数据集压缩为更小的数据集,使模型在小规模数据上训练后,在测试集上仍能达到接近在原数据集训练的性能,从而实现训练加速与存储节省。然而,现有基于生成模型的算法无法保证生成代表性样本,且未利用各生成图像间的关系。
针对该问题,研究团队提出无约束噪声生成模型的数据集蒸馏算法,并在多个数据集上进行实验验证。研究团队在蒸馏阶段,提出自适应因子以及扩展极小极大损失;在部署阶段,通过二次蒸馏技术,分别对大小分辨率数据集采用在线蒸馏和离线蒸馏策略,并适配在生成对抗网络和扩散模型两种生成范式中,提高蒸馏图像分布的稳定性。研究团队进一步在理论上证明该算法能产生更低的泛化误差,且生成图像可作为数据集蒸馏的有效代理数据集。
主题:研究团队