DECS: 过度思考消减

论文: Overthinking Reduction with Decoupled Rewards and Curriculum Data Scheduling 会议: ICLR 2026 (Oral) 作者: Shuyang Jiang (复旦大学), Yusheng Liao, Ya Zhang, Yanfeng Wang, Yu Wang (上海交通大学 / 上海人工智能实验室) 链接: OpenReview | GitHub


问题背景

大型推理模型 (LRM) 通过 RLVR(基于可验证奖励的强化学习,如 GRPO)训练后,常出现"过度思考"(overthinking)现象——模型生成过长的推理链而不带来任何性能提升。现有的长度惩罚方法往往导致性能下降,根本原因在于轨迹级奖励与 token 级优化之间的错位

理论发现

论文揭示了当前长度奖励方法的两个关键缺陷:

缺陷一:错误惩罚探索性 token(定理 1)

当一个简单 prompt 的所有 rollout 都正确时,较长轨迹获得负优势值,该负值会传播到所有 token,包括高熵决策 token(如"wait"、"alternatively")。这些 token 本是有效推理的关键,却被错误抑制。

当批次中简单 prompt 比例 κ 与响应长度标准差 σ_L 的乘积超过常数 C 时,高熵 token 的 logit 期望变化为负,策略偏离性能-效率前沿。

缺陷二:错误奖励冗余 token(定理 2)

在没有显式解耦"必要推理前缀"(NRP)的情况下,较短轨迹中 NRP 之后的冗余 token 仍可获得正优势值,错误强化了过度思考行为。策略无法学会在 NRP 结束处停止生成。

方法:DECS 框架

DECS 包含三个核心组件:

1. NRP 检测(§4.1)

必要推理前缀(Necessary Reasoning Prefix) 定义为首次推导出正确答案的最短前缀。

训练一个轻量级判断模型 M_judge,将推理过程按分隔符切分为多个 chunk,逐个判断是否已蕴含正确答案。第一个判断为"yes"的 chunk 即为 NRP 边界。

2. 解耦 token 级奖励(§4.2)

对不同位置的 token 分配不同奖励:

  • NRP 内的 token:始终获得最大奖励 r⁺
  • NRP 之后的冗余 token:获得 r₀ − α·(Lᵢ/L_max) 的较低奖励
  • 答案结论 token:始终获得非负优势

这确保冗余 token 始终获得负优势值,通过自回归生成的特性,一旦第一个冗余 token 被抑制,后续冗余也随之消除。

3. 课程 Prompt 调度(§4.3)

自适应调整批次中简单 prompt 的比例 κ:

κ_m = clip(κ_{m-1} + β(R_m - R_{m-1}), 0, κ⁰_m)

随着冗余比例下降,逐步增加简单 prompt 的比例,避免过度抑制探索行为,满足定理 1 的条件。

实验结果

主要结果

模型 Token 减少 Pass@1 变化 AES
DeepSeek-R1-Distill-1.5B 57.17% +2.48 0.74
DeepSeek-R1-Distill-7B 49.50% +0.80 0.54
Qwen3-4B 54.80% +1.32 0.61

关键发现

  • 在 7 个基准(MATH500、AIME2024/2025、AMC23、OlympiadBench、GPQA-Diamond、LiveCodeBench)上减少超过 50% 的推理 token,同时保持或提升准确率
  • 尽管仅在数学数据上训练,仍能泛化到科学(GPQA-D 减少 56.33%)和编程(LCB 减少 33.52%)任务
  • Pass@K 曲线与基础模型几乎完全重合,证明探索能力未受损
  • 压缩效果在所有难度级别上保持一致

消融实验

  • 去除课程调度:性能明显下降(验证定理 1)
  • 去除解耦奖励:约 25% 的过度思考 token 残留(验证定理 2)
  • 两个组件互补且缺一不可

核心洞察

  1. 序列级长度惩罚与 token 级优化之间存在根本性错位
  2. 高熵 token 是有效推理的关键,不应被一刀切地惩罚
  3. 通过精确识别 NRP 边界并解耦奖励,可以在不损害推理能力的前提下大幅提升效率
  4. 课程调度提供了稳定训练的保障,防止探索能力退化

实验配置

  • 训练集:DeepScaleR
  • 训练框架:veRL
  • 硬件:4×NVIDIA A100 80GB
  • 超参数:r⁺=1.1, r₀=1.0, β=0.2, 每个 prompt 16 rollouts
AI Assistant
Selected Text