

Advances in Neural Information Processing Systems
(NeurIPS, CCF-A类国际人工智能会议),题目为《Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning》。阿里巴巴集团Qwen团队、清华大学LeapLab的王慎执为此文的第一作者。阿里巴巴集团Qwen团队的郁博文、清华大学LeapLab的黄高为此文的通讯作者。
论文链接:https://doi.org/10.52202/085713-3850

可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards,RLVR)已成为增强LLM推理能力的一种有效方法,但其机制尚不清楚。作者通过token熵模式的新视角对RLVR进行了开创性探索,全面分析了不同的token如何影响推理性能。通过考察COT推理中的token熵模式,作者观察到只有一小部分token表现出高熵,而这些token是引导模型走向不同推理路径的关键fork token。进一步地,研究RLVR训练过程中熵模式的演化,发现RLVR在很大程度上遵循了基础模型的熵模式,主要是调整高熵标记的熵。这些发现凸显了fork token(高熵token)对RLVR的重要意义。作者最终通过将策略梯度更新限制在fork token上来改进RLVR,并发现了一个甚至超越二八效应的发现:仅使用20%的令牌,同时在Qwen3 - 8B基础模型上保持了与全梯度更新相当的性能,并显著超过了Qwen3-32B (AIME’25上+11.04 , AIME’24上+7.71)和Qwen3-14B (在AIME’25上+ 4.79 ,在AIME’24上+ 5.21)基础模型上的全梯度更新,显示出很强的缩放趋势。 相比之下,仅在80%最低熵令牌上进行训练会导致性能的显著下降。这些发现表明,RLVR的有效性主要来自于优化决定推理方向的高熵令牌。总的来说,我们的结果突出了通过令牌熵视角来理解RLVR的潜力,并通过利用高熵的少数令牌来优化RLVR,以进一步改进LLM推理。

图1 高熵少数 token 决定推理分支路径的机制与实验效果对比
LLM的数学、代码推理能力得到飞速发展,o1、Claude 3.7、DeepSeek‑R1、Kimi K1.5、Qwen3 等模型的突破,很大程度得益于RLVR技术。RLVR 依靠答案正确性自动得到奖励信号,完成模型输出的优化。但作者指出,现有 RLVR 实现会对整条 CoT 轨迹内全部 token执行策略梯度更新,忽略不同 token 在推理流程里承担的差异化作用,没有聚焦推理序列中关键决策位置,限制了性能进一步提升。
该研究从token 熵这一新视角剖析 RLVR 的内在作用机理,探究不同熵水平的 token 对推理效果带来的影响。通过分析 LLM 的CoT 生成过程,作者发现 token 熵的分布具备明显特点:绝大多数 token 属于低熵,仅有少部分 token 拥有高熵。低熵 token 主要用于补全已有的语言结构;而高熵 token 是推理中的关键分叉点(forks),决定模型后续走向哪一条推理路径,对应论文图 1(a) 。作者还开展了控制实验,在解码阶段人为调整fork token 的熵,实验证明适度提升frok token 熵能够改善推理效果,人为压低熵则会造成性能下降,验证了高熵fork token 的重要价值。
接着作者分析 RLVR 训练全过程的 token 熵动态变化,研究表明:RLVR 训练基本继承基座模型原本的熵分布模式,不会彻底改写哪些位置该犹豫、哪些位置该确定;训练过程主要改变的是原本就属于高熵的 token,低熵 token 的熵波动范围很小。
基于fork token 的相关发现,作者对 RLVR 算法做出改进:仅选取每个 batch 内熵最高的 20% 的 token 参与策略梯度更新,屏蔽剩余 80% 低熵 token 的梯度。实验结果显示,在 Qwen3‑8B 基座模型上,该方法可以和全部 token 参与更新的原版 RLVR 效果持平;随着模型参数量增大,收益持续放大,Qwen3‑32B 在 AIME’25 指标提升 11.04、AIME’24 提升 7.71;Qwen3‑14B 在 AIME’25 提升 4.79、AIME’24 提升 5.21(见图 1 (b))。将最大生成长度拓展至 29k 后,32B 模型在 AIME’24 数据集得分进一步达到 68.1。与之相反,如果只拿 80% 低熵 token 做训练,推理性能会出现明显退化。上述现象也印证,RLVR 带来的推理能力增益,几乎来源于少数高熵分叉 token。
作者进一步通过多组消融实验探究该方案背后的机理,测试 10%、20%、50%、100% 等不同 token 选取比例。实验证明,大约保留 20% 高熵 token 可以实现探索能力与最终效果的最优平衡;比例过高或者过低,都会降低整体熵,削弱模型探索能力,性能随之变差。该方法的增益还存在模型缩放特性:32B 模型收益最大,14B 次之,8B 模型提升有限,作者推测小模型本身能力上限不足,无法充分受益于增强的路径探索。
最后该研究总结三条核心结论:
①CoT 生成中只有少量高熵 token 充当推理分叉点,维持分叉 token 的高熵有利于推理;②RLVR 大体保留基座模型熵模式,主要对高熵 token 做调整;
③RLVR 的性能提升主要来自高熵 token,低熵token贡献微弱甚至会干扰训练。除此之外,作者还基于该现象延伸讨论:SFT容易发生记忆过拟合而RL具备更强泛化能力的内在原因、LLM‑CoT和传统RL轨迹熵模式的差异,以及 RLVR 中 clip‑higher 相比熵奖励的优势。分析COT推理中的token熵
已有很多研究注意到生成熵对思维链CoT推理的重要性,但大多对全部token做整体统计分析。该章节则落到token粒度开展细致分析。 作者使用 Qwen3‑8B 模型,在 AIME’24、AIME’25 数据集上以解码温度T=1.0生成推理样本,强制开启模型思考模式,收集超过10⁶条 token,全部按照公式(1)计算token熵,统计结果如图2所示;完整长CoT样本的token熵可视化结果放在附录图12‑17。通过统计,作者总结得到两条熵分布规律。
熵规律 1:CoT序列内只有小部分token为高熵,绝大多数token属于低熵。从图2(a)的熵分布直方图可以看到,大量 token 熵数值极低。统计显示约 50.64% 的 token 熵低于10⁻²,仅仅 20% 的 token 熵大于 0.672。
熵规律 2:高熵 token 多承担推理逻辑衔接工作;低熵 token 主要用于补全句子、完成词语构造。 作者从海量样本中筛选出现频次大于 100 的 token,分别取出平均熵最高、最低各 100 个 token 制作词云(图 2 (b)(c))。 高熵 token 大多是逻辑连接词,例如wait、however、unless、thus、since等,用于表达转折、递进、因果;数学推导中suppose、assume、given这类词也属于高熵,用于引入假设与已知条件。 而低熵 token 多为词后缀、代码片段、数学公式组成部分,输出确定性很高。其余大量 token 介于两者之间,兼具两种功能。
高熵 token:推理分叉 token(forking tokens)
基于上述两条规律,作者把高熵 token 命名为forking tokens(分叉 token),代表推理过程中不确定性高、会开启多条推理分支的关键位置。 为定量验证分叉 token 的作用,作者使用最大生成长度 28672 的 Qwen3‑8B,在 AIME 数据集评测时,对分叉 token 与普通 token 分配不同的解码温度,调整每个位置概率分布的计算规则:

公式作用:实现位置可变解码温度。 设置熵阈值0.672区分分叉token与普通token;如果当前位置是分叉token,使用较高的解码温度;普通token使用较低温度。用来做对照实验,单独放大/抑制分叉位置的随机性,验证分叉token对推理性能的贡献。
其中阈值h_threshold=0.672,取自全部样本熵的 80 分位数,作为区分分叉 token 与普通 token 的阈值;T_high、T_low分别对应分叉 token、普通 token 的解码温度。改变T_high与T_low得到的实验结果见图 3。 实验现象表明:压低分叉 token 的温度,性能会出现明显下滑;适当提高分叉 token 温度能够显著提升推理效果;但单纯提升普通低熵 token 的温度,反而会让 LLM 输出无意义文本。 这证明分叉 token 适合设置更高解码温度,高熵可以让模型开辟更多样的推理路径,进一步佐证分叉 token 对推理任务的关键意义。

图3 解码温度对原版 DAPO 与仅高熵 token 训练模型 AIME 评测得分的影响
该章节基于第 3 节得到的 CoT 熵分布规律,进一步研究在 RLVR 训练全过程中,token 熵模式会发生怎样的变化。
RLVR 会基本保留基座模型原有的熵模式。为研究训练期间熵模式的变化,作者以 Qwen3‑14B 基座模型为对象,采用 DAPO 算法开展 RLVR 训练,实验细节见第 5 章节。训练完成之后,针对表 2 里的 6 个评测基准,每个问题让模型生成 16 条推理回复。 作者取出 RLVR 不同训练阶段的中间模型,计算每条回复内全部 token 的 logits,筛选出每一条样本中熵排名前 20% 的 token 位置。 随后计算重叠率:统计中间模型与基座模型、最终训练完成模型之间,“属于前 20% 高熵的 token 位置” 有多少是重合的。
实验结果如表 1 所示:随着训练步数增加,中间模型和基座模型的位置重叠率会缓慢下降,和最终 RLVR 模型的重叠率逐步上升;但训练收敛到 1360 步时,与基座模型的重叠率依旧高于 86%。该结果说明,RLVR 大体继承基座模型的熵模式,也就是模型在哪些生成位置会犹豫、哪些位置输出确定,不会被训练彻底改写。
表1 不同 RLVR 训练步数下中间模型与基座模型、最终 RLVR 模型的高熵 Token 位置重叠率

RLVR 主要改变高熵 token 的熵值,低熵 token 熵基本保持稳定。沿用表 1 相同的实验设置,作者按照基座模型的熵把所有 token 划分为每 5% 一档的分位区间,统计经过 RLVR 训练之后,每一档 token 的平均熵变化幅度。 实验现象为:在基座模型中初始熵越高的 token,经过 RLVR 训练之后熵提升幅度越大,再次印证 RLVR 保留基座原有熵分布特征。

图4 RLVR 训练下不同分位 Token 的平均熵变化量
可验证奖励强化学习 RLVR 已经成为训练推理大模型最主流的方案之一,但目前很少有研究分析,究竟哪一部分 token 真正为模型推理能力提升做出贡献。结合第 3、4 章节的发现,高熵少数分叉 token 起到关键作用。

图5 RLVR 训练过程中不同熵分位 Token 的熵随梯度步数的变化曲线
该算法在 DAPO 目标函数(公式 4)基础之上做修改,直接舍弃低熵 token 的策略梯度,只使用高熵 token 的梯度更新模型。 对从数据集采样得到的每一个 batch,算法的优化目标定义如下:

公式作用:改进版 DAPO 损失函数。 针对每个 batch 动态计算熵阈值,只允许熵高于阈值的高熵 token 参与损失与梯度计算;低熵 token 会被指示函数屏蔽,不产生梯度。同时归一化分母只统计有效高熵 token 的数量。
评测设置 选用 6 个数学推理领域常用基准数据集:AIME’24、AIME’25、AMC’23、MATH500、Minerva、OlympiadBench。全部采用零样本评测。每个问题生成 16 条独立回复,解码温度设置为 1.0,统计平均准确率与单条回复平均 token 长度。
表2 全 Token DAPO 与仅分叉 Token DAPO 在多数学基准上的性能对比

高熵 token 是大模型推理强化学习效果的主要驱动力 图 6 与表 2 对比原版 DAPO(全部 token 参与梯度)和仅保留前 20% 高熵 token 的改进算法。令人意外的是,直接丢弃底部 80% 低熵 token,不仅不会降低推理性能,在多个数据集上还带来效果提升。 在 Qwen3‑32B 基座模型上,AIME’24 指标提升 7.71,AIME’25 提升 11.04;Qwen3‑14B 在 AIME’24 提升 5.21,AIME’25 提升 4.79。而 8B 模型性能基本持平。 该结果说明,RLVR 带来的推理能力提升主要来自高熵 token;低熵 token 几乎没有正向贡献,甚至会对 14B、32B 这类更大模型产生干扰。
为进一步探究,作者调整比例参数做消融实验,结果见图 7 (a)。 对于 Qwen3‑8B,比例设置 10%、20%、50%,性能变化不大。 而 14B、32B 模型,如果将比例从 20% 下调到 10%,性能小幅下降;如果直接设置为 100% 也就是原版 DAPO,性能出现明显下跌。 这说明在合理范围内,性能对该比例不是特别敏感;聚焦高熵 token,不仅可以保住效果,大模型还能获得明显增益。

图6 DAPO 与仅分叉 Token DAPO 训练过程的准确率与输出长度对比曲线

图7 选取不同比例高熵 Token 进行 RLVR 训练的准确率与全局熵变化曲线
低熵 token 对推理性能提升贡献极小 如图 7 (a)(b),如果反过来,训练的时候只使用底部 80% 低熵 token,即便这部分 token 数量占绝大多数,模型性能却出现明显衰减。这进一步证明低熵 token 几乎无法提升推理能力,高熵 token 才是训练的核心。
高熵 token 的价值来自于增强探索能力 分析表明,实验中大约 20% 高熵 token 可以实现探索能力与训练稳定性的最优平衡。从图 7 (b)(d)(f) 可见:比例改成 10%、50%、100%,训练早期整体熵就会变低,探索能力下降,最终效果变差。如果只拿低熵 80% 训练,整体熵会大幅降低。 这说明,保留合适数量的高熵 token 才能保证 RL 过程的有效探索;偏离该范围的 token 对探索没有帮助甚至起负面作用。这也解释为什么 32B 模型只训练分叉 token 效果显著优于原版 DAPO;而 8B 模型本身模型容量有限,无法充分受益于更强的路径探索,收益很小。
分叉 token 梯度更新策略在更大模型上收益更明显 图 8 展示缩放趋势:在 AIME’24、AIME’25 数据集上,模型参数量越大,该方法相对原版 DAPO 带来的性能提升就越突出。说明只聚焦分叉 token 做梯度更新,在更大推理模型上潜力更高。

图8 原始 DAPO 与仅分叉 Token DAPO 在不同模型规模下的缩放趋势
跨域泛化能力:本章节训练全部使用数学数据集 DAPO‑Math‑17K。作者进一步做分布外测试,在代码评测集 LiveCodeBench 上检验泛化能力。实验对象为 Qwen3‑32B,对比 top‑10%、top‑20% 高熵 token 方案和 100% 全部 token 的原版 DAPO,结果如图 9。 结果显示,即便只选取 10% 或者 20% 高熵 token 做梯度更新,在从未见过的代码数据集上,依旧显著优于原版 DAPO。这说明高熵 token 和模型泛化能力存在关联,只更新少量高熵 token,有助于提升模型跨任务泛化效果。

图9 不同高熵 Token 选取比例在域外测试集上的准确率收敛曲线
该章节基于全文实验结果,展开三点延伸分析,对现象背后的内在机理做推测与对比。
讨论一:高熵分叉 token 或可以解释 RL 泛化、SFT 容易记忆过拟合的差异
已有研究表明,基于结果奖励的强化学习 RL,面对从未见过的规则类任务具备很强泛化能力;而监督微调 SFT 更容易记住训练集样本,在分布外任务上泛化效果较差。 作者提出假设:两者泛化能力的差异,一部分来自分叉 token 的熵特征。结合图 5、图 7 的实验现象,RL 训练会保留甚至提升分叉 token 的熵,维持推理路径的灵活度。 与之相对,SFT 会把模型输出的概率分布推向确定的单峰分布,压低分叉 token 的熵,推理路径的灵活度随之丢失。 因此,推理路径的灵活程度,是模型能否很好处理未知新任务的关键因素。
讨论二:大模型 CoT 与传统强化学习轨迹的熵模式存在本质区别
传统强化学习环境中,一般假设每一步动作的熵是大致均匀的。但 LLM 的思维链推理不一样:模型融合预训练学到的先验知识,同时还要输出通顺可读的自然语言,最终形成 “大部分 token 低熵、少部分 token 高熵” 的混合分布,对应图 2 (a) 的统计结果。 传统 RL 大多使用高斯策略,所有动作步的熵基本保持一致。而大模型经过大规模预训练,绝大多数生成位置要贴合已经记住的语言、知识模式,因此表现为低熵;只有少数本身就存在不确定性的位置,才会具备高熵,留给模型做探索。该推论和表 1 的实验结果可以互相印证。
讨论三:RLVR 中全局熵奖励并非最优,clip‑higher 机制更适配大模型推理
在传统强化学习中,经常在损失函数加入熵奖励,通过提升所有动作的熵来鼓励探索,该方案也被迁移到大模型推理 RLVR 工作中。 但作者指出,这套全局熵奖励放到 CoT 推理任务上效果并不理想。因为大模型本身绝大多数是低熵 token,如果用熵奖励无差别抬高所有位置的熵,会破坏那些本就确定的低熵位置,带来性能下降;而只针对性提高高熵分叉 token 的熵,才能够带来性能提升,对应图 3 的实验。
所以不加区分的全局熵奖励并不适合思维链推理任务。反观 DAPO 中的 clip‑higher 非对称裁剪机制,能够更有针对性作用于高熵 token。 实验观察发现,重要性比例高的 token 往往本身就是高熵 token。clip‑higher 会对这部分 token 放宽正向更新约束,在提升整体探索性的同时,又不会过多干扰低熵 token,和图 5 的实验现象保持一致。
该研究从 token 熵这一新视角剖析 RLVR,为理解大语言模型推理的内在机制提供新的认识。 通过对思维链 CoT 推理开展分析,作者发现只有一小部分 token 具备高熵,它们充当推理路径的分叉点,决定后续推理走向。 对 RLVR 训练过程熵的动态变化分析表明,经过 RLVR 训练,模型会大体保留基座模型原本的熵分布特征,训练主要对原本就属于高熵的 token 做调整。
基于以上发现,作者对 RLVR 做改进,仅选取熵排名前 20% 的 token 参与策略梯度更新。该方法效果可以持平甚至超过全部 token 参与梯度更新的原版 RLVR,并且性能增益随模型参数量增大而提升。与之相反,如果把优化目标对准占大多数的低熵 token,模型性能会出现明显下降。 上述结果说明 RLVR 训练取得的效果,主要来自对这部分高熵 token 的优化,这也启示后续可以设计更加聚焦、高效的大模型推理强化学习方案。
局限性
作者指出该研究仍然存在可完善的地方: 第一,实验主要基于 Qwen 系列模型完成。虽然已经尝试在 Llama 模型上开展实验,但 Llama 模型在 AIME 评测集上很难取得理想效果,无法充分验证算法普适性。 第二,实验数据集局限于数学领域,还需要拓展到代码、ARC‑AGI 这类更加复杂的任务。 第三,现有结论建立在特定实验条件之上,不一定能够适配全部 RLVR 使用场景。例如本实验得到的 20% 这个最优比例,更换实验环境之后,最优占比可能需要重新调整。
未来工作
后续可以围绕高熵少数 token 开发全新的 RLVR 算法;同时这套 token 熵的研究思路,也可以拓展应用到更多技术方向,除 RLVR 之外,还包括监督微调 SFT、知识蒸馏、推理阶段解码、多模态训练等。
——END——
撰稿人:肖阳
审核人:李景聪

脑机接口与混合智能研究团队
