云霞资讯网

ICLR26:无标签场景下的RL RL LLM ICLR26 一、整体概述 1.

ICLR26:无标签场景下的RL
RL LLM ICLR26
一、整体概述
1. 论文提出RESTRAIN,让大模型无需标准答案,也能靠自己的多次作答进行强化学习。
2. 核心贡献是把“不确定性”变成训练信号,既利用可能正确的少数答案,又主动惩罚不可靠推理,从而避免自训练越练越错。

二、研究背景
1. 传统推理强化学习依赖人工或可验证答案,数据成本高,也难覆盖人类都无法确定答案的任务。
2. 已有无标签方法常把多数票当伪答案,但难题中多数人也可能一起答错,真正正确的推理反而藏在少数结果里,最终容易造成模型过度自信甚至训练崩溃。

三、动机直觉
1. 可以把模型想成同一道题做很多遍。
2. 作者认为,与其看到十次里六次答案相同就宣布它是真理,不如观察整组答案的分布。
3. 多数答案更可信,但少数答案也不能直接丢掉;如果所有答案都很分散,则说明模型根本没把握,此时不该奖励任何路线,而应促使它换思路探索。

四、技术路线
1、以GRPO为强化学习基础。
2、加入三层自我约束:
①伪标签加权:所有不同答案都参与训练,出现频率越高权重越大。
②负向轨迹惩罚:若整体共识低,则奖励归零,并给优势值加入负向偏移。
③提示级加权:用冻结的参考模型预先估计题目可靠性,越不确定的题目更新幅度越小。

五、实验结果
1. 在DAPO 14k MATH上,Qwen3 4B平均Pass@1达到51.0,明显高于TTRL的42.2,并几乎追平使用标准答案训练的51.4。
2. 最高相对提升达到AIME25的140.7%、MMLU STEM的36.2%和GPQA Diamond的19.6%。
3. 更有意思的是,MMLU STEM达到80.9,超过有标签GRPO的73.7,说明这种训练方式还带来了更好的跨领域泛化。