证明
分类
路线
RL专家处理的是另一层问题:怎样改变这些证明路线被抽中的概率。
文章
几部分合在一起,解决的是有限推理算力怎样覆盖更多证明路线的问题。
文章
空间
一个只会重新作答的模型,每次失败后都要重新进入整个证明空间;
文章
加入经过不同后训练的checkpoint,相当于主动改变采样分布,让计算资源进入另一片证明空间。
文章
生成
但IMO这条链已经把问题暴露得很清楚:证明生成可以依靠更多proposal和更多test-timecompute继续扩展,验证却还没有同样稳定的scaling路线。
文章
搜索
2026年09月15日17:38雷锋网用三套checkpoint完成多轮证明搜索,用过程透明平息学术怒火,用1.5TB显存门槛锁定算力霸权。
文章
Nemotron3Ultra只是底座,后面两个专家模型、大规模证明搜索、模型验证和多轮改写,共同组成了把成绩推到IMO金牌线的完整链路。
文章
修改
SFT数据里除了完整证明,还加入了大量证明修改、验证和再次验证的轨迹。
文章