

该论文发表于Advances in Neural Information Processing Systems(NeurIPS, CCF-A类国际人工智能会议),题目为《Reinforcement Learning for Reasoning in Large Language Models with One Training Example》。
华盛顿大学王宜平为此文的第一作者,华盛顿大学王宜平、微软王硕航、华盛顿大学杜少雷、微软沈烨龙为此文的通讯作者。
论文链接:https://doi.org/10.48550/arXiv.2506.01939

作者证明:仅使用一条训练样本的可验证奖励强化学习(1‑shot RLVR),就可以有效激发大语言模型的数学推理能力。 将 RLVR 作用于 Qwen2.5‑Math‑1.5B 基座模型,我们找到一条关键样本,可将模型 MATH500 数据集性能从 36.0% 提升至 73.6%;剔除格式修正带来的收益后,真实增益为 8.6%。在 6 个主流数学推理基准上,平均性能由 17.6% 提升至 35.7%,去除格式带来的提升后净增益 7.0%。 该效果与使用 1200 条样本的 DeepScaleR 子集训练结果几乎持平(MATH500:73.6%,平均 35.9%),而这个 1200 条的数据集里恰好包含这一条关键样本。更进一步,仅使用 2 条样本做 RLVR,性能还可以小幅超越上述结果。
该显著提升在多类模型、强化学习算法以及不同数学样例上均可复现。 此外,论文观测到 1‑shot RLVR 下多个特殊现象:跨类别泛化、模型自我反思输出变多;训练集准确率已经饱和之后,测试集指标依旧持续上涨,作者将该现象命名为post‑saturation generalization(饱和后泛化)。
实验证实 1‑shot RLVR 的效果主要来源于策略梯度损失,和深度学习里的 grokking(迟泛化)现象本质不同。同时证实:训练中引入合适系数的熵损失来鼓励探索,对 1‑shot RLVR 至关重要。 论文还讨论了格式修正、标签鲁棒性、提示词改动带来的各类实验现象。这些发现能够启发后续 RLVR 效率方向的研究,也促使学界重新审视 RLVR 近期的进展以及背后底层机理。
近期,大语言模型的推理能力取得巨大进展,代表工作包括 OpenAI‑o1、DeepSeek‑R1、Kimi‑1.5,尤其在复杂数学任务上效果突出。推动该进步的核心技术是可验证奖励强化学习 RLVR:对大模型执行强化学习,采用基于规则的结果奖励,例如针对数学题最终答案是否正确给出二值奖励。
学界已经观测到 RLVR 中诸多有趣实验现象:可以激发增强模型特定认知行为(比如自我反思)、在各类下游任务上获得泛化提升。目前大量研究聚焦于优化 RL 算法(PPO、GRPO 等),以此提升 RLVR 的性能与训练稳定性。
但与之相对,RLVR 的数据侧研究却很少被关注。尽管已有不少工作去构建高质量数学推理数据集,但很少去探究数据本身在 RLVR 中起到的具体作用。由此衍生出一系列关键开放问题:真正需要多少训练数据?什么样的数据效果最好?训练数据的质量、数量,和观测到的现象(自我反思、泛化能力)之间是什么关系?
和本文最相关的工作是 LIMR,该工作提出 LIM 指标衡量训练样本的作用,依靠该指标,在性能基本不变的前提下,把训练样本压缩为原来的 1/6。但该工作没有探索数据集还能压缩到多极致的程度。
基于上述背景,本文提出核心研究问题:在保证和全数据集训练相当性能的前提下,RLVR 的训练集最多可以压缩到多小?
本文通过实验得到一个出人意料结论:RLVR 训练集甚至可以压缩到仅 1 条样本。该结果也佐证现有基座模型本身已经具备很强的推理潜能,仅仅一条样本就可以大幅度放大基座模型数学能力,本文将这套设置命名为1‑shot RLVR。

图1 不同训练样本规模下 RLVR 训练的准确率收敛曲线
模型
本文默认主实验使用 Qwen2.5‑Math‑1.5B;3.3 节同时在 Qwen2.5‑Math‑7B、Llama‑3.2‑3B‑Instruct、DeepSeek‑R1‑Distill‑Qwen‑1.5B 上验证 1‑shot RLVR 效果。。
数据集
受算力资源限制,从 DeepScaleR‑Preview‑Dataset 随机抽取 1209 条样本作为实验子集,记为 DSR‑sub。 针对 2 节的数据筛选流程:先用 Qwen2.5‑Math‑1.5B 跑 500 步 RLVR 训练,计算每条样本的历史方差分数,得到样本排序。 全文所有实验固定这套排序,不再改动样本与排序编号的对应关系,全部基于 Qwen2.5‑Math‑1.5B 算出的历史方差打分。 另外也使用 MATH 训练集(7500 条)做全集 RLVR 作为对比基线。
训练
全部实验基于 verl 训练流水线。默认 KL 损失系数 β=0.001,熵损失系数 α=‑0.001。 vLLM 生成阶段温度设置 0.6。训练 batch 大小 128,每个 Prompt 采样 8 条回复;每一轮生成步骤会执行 8 次梯度更新。 Prompt 最大长度 1024,输出最大长度 3072,匹配 Qwen2.5 系列 4096 上下文窗口。 针对 Qwen 模型,设置格式奖励基线:只要输出可以解析出最终答案就给予奖励 1,用来区分 “格式变好” 和 “推理能力变强”。
评测
采用 Qwen2.5‑Math 官方评测流程。 使用 6 个数学推理测试集:MATH500、AIME 2024、AMC 2023、Minerva Math、OlympiadBench、AIME 2025。 同时使用非数学推理数据集 ARC‑Easy、ARC‑Challenge。
AIME2024、AIME2025、AMC2023 题目数量少(30‑40 题),为保证评测稳定,测试集重复 8 次,生成温度 0.6,报告 avg@8 平均 pass@1。 其余 3 个数学基准评测温度设置为 0。
图 1 实验结果表明:只用 1 条或者 2 条样本做 RLVR,性能可以和上千样本的 RLVR 持平,格式收益与真实推理收益均有明显提升。 表 1 进一步说明:只用数学样本训练的 1‑shot RLVR,还可以在非数学推理任务上取得更好泛化效果,附录 C.1 提供更多细节。本节对 1‑shot RLVR 展开详细分析。
样本 π1 解析:一道难度并不高的题目
首先分析带来巨大增益的样本。表 2 展示排序第一位样本 π1,这是一道带物理背景的代数题。 核心步骤:由公式 P = kAV³ 求得 k=1/256,再计算 V 等于 2048 的立方根,结果约 12.699。
有意思的是:基座模型本身几乎就可以解出这道题。图 3 显示,未经任何训练的基座模型,高概率完成除开 “求 2048 立方根” 以外的全部推导步骤;仅仅最后开立方一步输出五花八门,包括 4、10.95、12.6992、12.70、12.8、13 等。 对基座做 128 次采样:57.8% 输出 12.7/12.70,6.3% 输出 12.8,6.3% 输出 13。 本文用到的其它样本见附录 E。附录 C.2.5 做对照:仅仅把 “2048 开立方” 这一个子问题拿出来训练,效果远不如完整的 π1 题目。
表2 Π1提示词

饱和后泛化现象

图2 RLVR 训练集准确率与测试集泛化性能的变化曲线
1‑shot RLVR 出现一个关键现象。见图 2:虽然只有一条训练样本,π1、π13 在 100 步以内训练集准确率就已经饱和。 但是测试集指标还在持续上涨: π1 从 100 步到 1540 步,平均指标继续上涨 3.4%; π13 从 500 步到 2000 步,平均指标上涨 9.9%。
使用 DSR‑sub 全集训练时观测不到该现象,全集训练还没收敛,测试集性能就已经开始下降。
对比训练、测试输出(图 3):训练后期,模型对单条训练样本发生过拟合,会把正确计算过程混杂在大段无法读懂的多语言乱码里面。 但是测试集输出依旧正常可读,测试集准确率依旧很高。即便已经对训练样本过拟合,饱和后泛化现象依然成立。
RLVR 下过拟合发生很晚:π1 约 1400 步之后,π13 约 1800 步之后。每一步会对样本采样 1024 次,意味着要经过数百万次样本生成之后,才出现过拟合。
大量样本都可以实现 1‑shot RLVR;出现跨类别泛化
本节探究:不同样本做单样本 RL 效果差异;只用某一类别的单条样本,是否可以泛化到其它类别。

图3 1‑shot RLVR 训练过程中训练样本与测试样本输出样例
挑选不同历史方差档位的样本:高方差(π1 ~ π17)、中等方差(π605、π606)、低方差(π1201 ~ π1209),覆盖不同题目类型,按照题目本身划分类别。
实验观测三点:
测试集上自我反思语句出现频次上升
本节给出另一个实验现象:随着 1‑shot RLVR 训练推进,模型输出里自我反思类内容变多。 读取 Qwen2.5‑Math‑1.5B 不同训练断点的输出,统计关键词:rethink、recheck、recalculate 的出现频次,统计在 6 个数学评测集上,结果见图 4。

图4 RLVR 训练过程中输出长度、熵损失与自我反思词数量变化
对比:使用 1200 条 DSR‑sub 全集训练时,反思类语句的频次反而随训练轻微下降,同时输出长度变短。
表3 不同训练样本下 1‑shot RLVR 在各数学评测集上的实验结果

表4 不同训练样本下 1‑shot RLVR 在各数学评测集上的实验结果

进一步验证 1‑shot / 少样本 RLVR 是否是通用现象,实验配置沿用 3.1,结果见表 4,每个基准完整数值见附录 C.1。
本章聚焦探究:仅仅一条或者少数几条样本,RLVR 就可以生效背后的潜在机理。希望下面的分析可以给后续研究提供启发。
前面章节提到,1‑shot RLVR 存在饱和后泛化现象。该现象和 grokking(迟泛化)有相似之处:grokking 是模型先记忆、过拟合训练集,但测试集表现很差,经过大量训练步数之后,泛化性能突然上涨。
自然产生问题:1‑shot RLVR 带来的性能提升,是不是来源于 grokking 现象?
grokking 会强烈受权重衰减这类正则项影响。为回答上面问题,本文做消融实验:逐个移除、修改损失函数各个组件,观察每一部分对性能的贡献。
表5 1‑shot RLVR 消融实验:各损失组件对训练收敛与泛化性能的影响

实验现象: 只用 π1 样本,仅开启策略梯度损失(第 2 行),得到的结果就已经非常接近完整损失全部打开的训练效果(第 5 行)。 在此基础之上,继续增加权重衰减(第 3 行)、增加 KL 损失(第 4 行),模型性能没有明显变化。 打开熵损失(第 5 行),MATH500 再提升 4.0%,AIME24 再提升 2.5%。
熵损失系数需要合理设置;系数过大(第 6 行),训练会变得不稳定。
以上结果说明:1‑shot / 少样本 RLVR 能够生效,主要归功于策略梯度损失,而不是权重衰减;这一点和 grokking 做本质区分,grokking 对权重衰减非常敏感。
进一步验证:只使用权重衰减 + KL 损失(第 8 行),几乎不会带来性能提升; 只保留策略梯度损失 + 熵损失(第 7 行),效果几乎等价于完整 GRPO 损失。
另外,鼓励模型输出多样性(例如配置合适的熵损失),能够增强 1‑shot RLVR 的饱和后泛化效果。 把生成温度调高到 1.0,可以再带来 0.8% 的额外增益。 关于熵损失与饱和后泛化更多讨论见附录 C.2.2。
从表 3 可以看到:使用 π1207、π1208 做 1‑shot RLVR 时,训练过程中模型很难输出标准答案,几乎拿不到奖励,策略梯度信号极度稀疏。 但即便如此,模型效果依旧优于基座,只是弱于格式奖励基线。
为解释该现象,作者从完整 GRPO 损失中移除策略损失(表 5 第 9 行),甚至只保留熵损失(第 10 行),依旧可以观测到一定程度性能上涨。 该现象在 Qwen2.5‑Math‑7B、Llama‑3.2‑3B‑Instruct 上同样会出现,只不过性能提升只出现在训练前期少数步数。
该结果说明:熵损失本身就可以独立带来一部分格式修正层面的性能提升;虽然远小于策略梯度带来的收益,但提升不可忽略。

图5 熵损失与解码温度对 6 项数学基准平均准确率的影响曲线
本文证明,1‑shot RLVR 就足以让模型在推理任务上获得大幅提升,甚至可以达到使用数千条样本训练的 RLVR 的效果。 实验结果不仅体现任务指标提升,还观测到一系列现象:饱和后泛化、跨类别泛化、自我反思行为频次提升,以及其它相关实验结论。
这些结果说明:部分基座模型内部本身已经具备推理潜能;只需要极少的数据,通过鼓励输出探索,就可以生成有效的强化学习信号,把大模型内在的推理能力激发出来。 同时该结果也体现:基于零均值优势值的 RLVR 算法具备很强的抗过拟合特性。哪怕对单一样本重复训练数百万次,模型性能也不会发生下降。 本文也进一步表明,对于 RLVR 任务,做好训练数据的筛选与数据集构建十分重要。
——END——
撰稿人:肖阳
审核人:李景聪

脑机接口与混合智能研究团队
