登录

走出数学与代码,大模型还能自我进化吗?


速读:2026年08月06日07:06机器之心Pro可验证奖励的强化学习(RLVR)逐渐成为提升大模型推理能力的重要技术路线。 现有方法往往依赖人工偏好、奖励模型或LLMJudge评估输出质量,容易受到评估偏差和裁判模型能力的限制,同时还会增加训练阶段的推理成本。 数学答案可以与标准答案直接比对,代码则可以通过编译器和单元测试判断是否正确,因此模型能够以较低成本持续获得稳定的强化学习信号。 在数学和代码任务中,标准答案和编译器能够自动判断输出是否正确,从而为大规模强化学习提供准确、低成本的奖励信号。 RLSVR将类似的任务变换思想引入强化学习,通过构造带有环境隐藏变量和确定性规则的代理任务,让开放式任务也能够产生可验证奖励。
2026年08月06日 07:06

可验证奖励的强化学习(RLVR)逐渐成为提升大模型推理能力的重要技术路线。在数学和代码任务中,标准答案和编译器能够自动判断输出是否正确,从而为大规模强化学习提供准确、低成本的奖励信号。

然而,创意写作和研究分析等开放式任务通常不存在唯一正确答案。现有方法往往依赖人工偏好、奖励模型或 LLM Judge 评估输出质量,容易受到评估偏差和裁判模型能力的限制,同时还会增加训练阶段的推理成本。如何为开放式任务构造稳定、可扩展且能够自动验证的奖励,成为 RLVR 进一步扩展的关键障碍。

受到自监督学习的启发,作者提出了  RLSVR(Reinforcement Learning with Self-Verifiable Rewards) 训练框架。自监督学习通过掩码预测、对比学习等代理任务,从数据本身生成训练标签;RLSVR 将类似的任务变换思想引入强化学习,通过构造带有环境隐藏变量和确定性规则的代理任务,让开放式任务也能够产生可验证奖励。

论文标题:From RLVR to RLSVR: Task Transformation Induces SelfVerifiable Rewards for Open-Ended LLM Self-Improvement

代码链接:https://github.com/wangqinsi1/RLSVR/tree/SpyRL 

论文链接: https://arxiv.org/abs/2607.23802

基于这一思路,作者进一步提出自博弈训练方法实例  SpyRL(Self-PlaY Reinforcement Learning) 。其核心是构造一个信息不对称的多智能体博弈环境:不同智能体在掌握信息量存在差异的条件下完成同一目标任务,并通过彼此的输出进行比较、判断和互动。环境预先记录造成信息差异的隐藏状态,因此博弈结果可以被自动、精确地验证;与此同时,智能体能否在竞争中取得优势,又取决于其完成原始任务的质量。由此,开放式任务中难以直接衡量的能力,被映射为可用于强化学习的规则化奖励信号。

从 RLVR 到 RLSVR:

为开放式任务构造可验证奖励

RLVR 能够有效提升数学推理和代码生成能力,关键在于这些任务拥有确定性的验证机制。数学答案可以与标准答案直接比对,代码则可以通过编译器和单元测试判断是否正确,因此模型能够以较低成本持续获得稳定的强化学习信号。

开放式任务的情况更复杂。摘要、写作和研究分析通常不存在唯一答案,任务质量分散在完整性、逻辑性、相关性和创造性等多个维度中,很难通过简单规则直接计算。奖励模型和 LLM Judge 虽然可以提供近似评价,但训练效果会受到评估器能力、偏差和推理成本的影响。

针对这一问题,RLSVR 引入了 任务变换(Task Transformation) 。其基本思想是将原始开放式任务转化为一个可验证的代理环境,并在环境中主动构造监督信号。环境首先从原始数据中采样任务,再注入并记录一个隐藏变量,例如哪个输入受到扰动、哪部分信息被删除,或某个输出在什么条件下生成。模型仍然需要完成原始目标任务,从而保证训练过程中使用的能力与真实应用场景保持一致;随后,模型通过输出之间的比较和交互,对环境中的隐藏状态作出判断。

由于隐藏变量由环境预先生成并保存,模型的判断结果可以通过确定性规则直接核验。这样一来,原本难以直接衡量的输出质量,就能够通过代理环境中的交互结果转化为强化学习奖励。论文将这种奖励称为 自可验证奖励(Self-Verifiable Rewards) :它不依赖人工标注或外部裁判,其验证依据来自环境自身的状态和规则,标准答案在任务生成时就已经确定。

从这个角度看,RLSVR 可以视为将自监督学习的思想引入 RLVR。自监督学习通过代理任务从数据中自动生成标签,RLSVR 则通过任务和环境变换自动生成奖励。任务变换对应代理任务,环境隐藏变量对应自动构造的标签,最终得到的规则化奖励可以直接用于 GRPO 等现有强化学习算法。RLSVR 由此提供了一条新的路径:开放式任务的可验证性可以通过环境设计获得,并进一步支持大规模、低成本的模型自我进化。

SpyRL:基于自博弈的 RLSVR 的实例

为了验证 RLSVR 能否真正应用于开放式任务,作者设计了一个基于信息不对称自博弈的具体实例—— SpyRL(Self-PlaY Reinforcement Learning) 。SpyRL 将摘要、创意写作和数学推理等任务嵌入一个类似「谁是卧底」的多智能体环境中,通过环境预先分配的隐藏身份,为原本缺乏标准答案的任务构造可验证奖励。

如论文图 2 所示,SpyRL 的每轮训练包含  Performing  和  Detection  两个阶段。首先,环境从任务数据中采样一个输入,并随机指定一名玩家为 spy。其余 civilian 玩家获得完整输入,spy 则只能看到经过信息降质处理的版本,例如被连续遮盖部分内容的报告、写作提示或数学材料。随后,所有玩家根据各自掌握的信息完成同一个目标任务,生成摘要、故事或数学问题及解答。信息降质只移除影响任务完成的关键内容,同时尽量保持输入的主题、风格和表面形式一致,以避免模型通过长度、格式等简单特征识别身份。

在 Detection 阶段,所有输出会被公开,玩家需要结合这些结果判断谁获得了残缺信息。由于 spy 的身份由环境提前随机指定,投票是否正确能够直接与环境记录进行比较,Detection 阶段也因此获得了确定性的奖励。与此同时,一个玩家生成的内容越不完整、逻辑越薄弱,越容易暴露其信息缺失并收到更多怀疑票。因此,投票结果也可以反向用于评价 Performing 阶段:收到的怀疑票越多,任务执行奖励越低;能够生成更完整、更连贯、更具说服力输出的玩家,则更有可能避免被识别。

这两个阶段共同构成了 SpyRL 的闭环自博弈机制。检测能力提升后,模型能够发现输出中更细微的缺陷,给执行者带来更严格的训练信号;执行能力提升后,不同玩家的输出会变得更难区分,又会推动检测模型继续进化。作者对两个阶段进行交替优化:当检测任务已经较为容易时,训练重点转向执行模型;当执行模型的提升导致身份识别准确率下降时,再增强检测模型。这样的动态过程能够持续围绕模型当前的能力边界产生学习压力,降低固定评估器逐渐失效带来的训练停滞。

在奖励设计上,Detection 阶段根据身份判断是否正确获得可验证奖励,并通过类似 GRPO 的组内相对优势进行优化。Performing 阶段则采用零和奖励,将 spy 与 civilian 之间的竞争以及 civilian 内部的相对表现结合起来。

通过这样的设计,SpyRL 将「输出质量」映射为「输出是否暴露了信息缺失」,再将身份判断结果转化为可由环境直接核验的训练信号。整个训练过程不需要人工标注、奖励模型或外部 LLM Judge,并且执行阶段始终围绕原始目标任务展开,从而保证代理博弈所训练的能力能够迁移回摘要、写作和推理等真实任务。

实验结果

作者在 Qwen3-4B 和 Qwen3-8B 上验证了 SpyRL,实验覆盖文本摘要、创意写作和数学推理三类任务,并与 R-Zero、Absolute Zero 等自进化方法进行比较。评估同时采用任务专用自动指标、GPT-4o 成对 A/B 测试和人工盲测,以考察模型在客观指标和人类偏好下的表现。

在文本摘要任务中,SpyRL 在 GovReport、Multi-News、QMSum、VCSum 和 SAMSum 五个数据集上均取得最高的 ROUGE-L。以 GovReport 为例,Qwen3-4B 的 ROUGE-L 从 30.2 提升至 36.7,Qwen3-8B 则从 29.0 提升至 34.1。在与未经训练的基础模型进行 A/B 测试时,SpyRL 在五个数据集上的平均胜率分别达到 73.9% 和 75.4%,并且在与 R-Zero、Absolute Zero 的对比中赢得了绝大多数测试。这表明,基于身份识别产生的训练信号能够有效改善摘要的完整性、信息覆盖和组织质量。

主题:奖励|开放式任务|强化学习|模型