登录

一个


分类

问题

一个问题是:我们的训练任务什么时候停止?
文章

一个问题,是关于任意时间学习(AnytimeLearning)的一个非常基础的问题。
文章

简单

当大模型预训练还在靠一堆“炼丹术”般的启发式规则苦苦调参时,哈佛大学计算机科学系GordonMcKay教授、Kempner研究所联合主任ShamKakade抛出了一项反直觉的研究:一个简单到离谱的二次模型,就能精准预测大语言模型在动态预训练中的绝大部分优化效果。
文章

我不打算深入技术细节,但核心结论是:即使在这样一个简单的“玩具模型”中,我们也能得到相当丰富的答案。
文章

真正

我们有一个非常简单的下界(LowerBound),它针对特定的学习率设定,但我认为它能给出正确的直觉——对于任何多项式衰减的学习率调度,基本上都不存在一个真正的随时学习方案。
文章

特定

我们首先从一个特定的二次模型(QuadraticModel)开始聊。
文章

我们首先着眼于一个特定的简化模型,探索其能力极限,并依次探讨任意时间学习(AnytimeLearning)、批量大小缩放(BatchSizeScaling)、动量(Momentum)等问题;
文章

效果

临界批量大小是并行化中最自然的一个概念——它决定了我们能够在多大程度上通过增加并行度来缩短串行运行时间。
文章

影响

当然,这只是一个非常简单的二次模型,那么平均(Averaging)的方法,为什么能在如此复杂的神经网络中起作用呢?
文章

其它

为什么一个如此简单的模型能做到这一切?
文章