登录

训练


分类

训练

GLM-5.2训练结束、参数冻结、进入部署后
文章

LongStraw,它跑在MinT的训练侧,解决的问题是:长上下文推理早就跨过了百万token,但强化学习训练还没有。
文章

MindForge,一个面向智能体强化学习的训练框架。
文章

它能把已具备生产就绪能力的Harness直接引入强化学习闭环,用同样的路由工具、记忆布局、工具调用方式和Harness结构,确保模型训练时的条件与它最终运行时一致。
文章

状态

参数空间的迭代:把经验写进模型的可训练状态。
文章

参数

32B模型用r=8的LoRA,可训练参数只剩0.07B,增益达到20.61%。
文章

7B模型用r=64的LoRA,可训练参数降到0.16B,增益反而升到11.31%;
文章

更值得看的是另一组对比:在相近的RL预算下,1.5B模型做全参数RL,可训练参数1.5B,AIME2025上的归一化增益为8.33%;
文章

效果

而在工程侧,明星创业公司ThinkingMachinesLab也在验证一条高度相似的技术路径:用LoRA这类高效后训练手段,如果配置得当,可达到接近全参数微调的效果,同时还能大幅降低算力开销。
文章

影响

训练的那一小块越小,底座越强,拿到的增益反而越高。
文章