跳转至

大模型RL为何越训越窄?ACL 2026杰出论文揭秘熵坍缩真相

Ch01.1240 大模型RL为何越训越窄?ACL 2026杰出论文揭秘熵坍缩真相

📊 Level ⭐⭐ | 4.6KB | entities/llm-rl-entropy-collapse-acl-2026-outstanding-paper.md

大模型RL为何越训越窄?ACL 2026杰出论文揭秘熵坍缩真相

浙江大学、腾讯等机构的论文 "Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective" 获 ACL 2026 Outstanding Paper Award。该工作从 token-level 熵变出发,重新解释 RLVR 中的熵坍缩现象,并提出熵稳定方法 STEER,在数学推理和代码任务上取得稳定提升。

原文存档

问题:RLVR 训练中的熵坍缩

RLVR(Reinforcement Learning with Verifiable Rewards)正在成为大模型后训练的关键技术。然而,训练中策略熵(policy entropy)会快速下降,导致模型输出逐渐同质化,采样路径变窄,训练也可能提前停滞。

对于 GRPO 这类 group-based 算法,问题尤为严重:当同组采样回答越来越相似,组内 advantage 信号失去区分度,训练随之停滞。

Token-level 熵变分析

论文将 RLVR 训练视为一棵推理树的动态调整过程。每个 token 选择对应一个分叉节点,token 熵反映该节点的"有效分叉数"。RLVR 训练同时包含两种力量:

  • 增枝:奖励信号鼓励新的推理分支生长 → 推动熵上升
  • 剪枝:低奖励轨迹中的分支被压制 → 推动熵下降

健康的训练需要二者保持动态平衡。论文推导了 token-level 熵变的近似表达式,发现熵变方向主要由优势信号(advantage)token 生成概率共同决定:

类型 概率 优势 熵效应
高概率正样本 局部熵下降(路径强化)
低概率正样本 局部熵上升(保留探索)
高概率负样本 局部熵上升(释放概率空间)
低概率负样本 局部熵下降(剪枝)

现有方法的局限

从 token-level 熵变视角重新审视现有熵干预方法:

  • DAPO / Clip-Higher:放开 clip-high 让更多低概率正样本参与更新,但调节仍是粗粒度的
  • Positive-Reweighting:削弱高概率正样本权重、强化低概率正样本,但忽略了负样本中的熵变力量
  • Entropy-Aware Advantage:高熵 token 并不保证熵变方向,放大降熵方向的 token 反而会加速坍缩

这些方法缺乏对每个 token 熵变方向和幅度的直接刻画,对训练中熵动态的控制仍然是粗粒度的。

STEER:Token-level 熵变稳定器

论文提出 STEER(Stabilizing Token-level Entropy-changE via Reweighting)

  • 直接估计每个 token 在当前更新中的熵变
  • 对会带来过大熵变化的 token 降低权重(降权而非抹除)
  • 大多数 token 权重仍接近 1,学习信号不受大面积削弱

与常见的熵奖励(entropy bonus)不同,STEER 不是粗暴地"把熵拉高",而是让每一步训练的熵变化保持可控——像一个 token-level 的"限速器"。

实验结果: - 数学推理:Qwen2.5-Math-7B 平均分从 GRPO 的 44.2 提升至 48.6 - 代码任务:Qwen2.5-Coder-14B 代码编辑 42.6→45.1,LiveCodeBench v5 29.3→31.8 - 在不同模型(Qwen/Llama/Mistral)、算法(GRPO/RLOO/OPO)、规模上均表现稳定

相关实体