DECS: 过度思考消减
论文: Overthinking Reduction with Decoupled Rewards and Curriculum Data Scheduling 会议: ICLR 2026 (Oral) 作者: Shuyang Jiang (复旦大学), Yusheng Liao, Ya Zhang, Yanfeng Wang, Yu Wang (上海交通大学 / 上海人工智能实验室) 链接: OpenReview | GitHub
问题背景
大型推理模型 (LRM) 通过 RLVR(基于可验证奖励的强化学习,如 GRPO)训练后,常出现"过度思考"(overthinking)现象——模型生成过长的推理链而不带来任何性能提升。现有的长度惩罚方法往往导致性能下降,根本原因在于轨迹级奖励与 token 级优化之间的错位。
理论发现
论文揭示了当前长度奖励方法的两个关键缺陷:
缺陷一:错误惩罚探索性 token(定理 1)
当一个简单 prompt 的所有 rollout 都正确时,较长轨迹获得负优势值,该负值会传播到所有 token,包括高熵决策 token(如"wait"、"alternatively")。这些 token 本是有效推理的关键,却被错误抑制。
当批次中简单 prompt 比例 κ 与响应长度标准差 σ_L 的乘积超过常数 C 时,高熵 token 的 logit 期望变化为负,策略偏离性能-效率前沿。
缺陷二:错误奖励冗余 token(定理 2)
在没有显式解耦"必要推理前缀"(NRP)的情况下,较短轨迹中 NRP 之后的冗余 token 仍可获得正优势值,错误强化了过度思考行为。策略无法学会在 NRP 结束处停止生成。
方法:DECS 框架
DECS 包含三个核心组件:
1. NRP 检测(§4.1)
必要推理前缀(Necessary Reasoning Prefix) 定义为首次推导出正确答案的最短前缀。
训练一个轻量级判断模型 M_judge,将推理过程按分隔符切分为多个 chunk,逐个判断是否已蕴含正确答案。第一个判断为"yes"的 chunk 即为 NRP 边界。
2. 解耦 token 级奖励(§4.2)
对不同位置的 token 分配不同奖励:
- NRP 内的 token:始终获得最大奖励 r⁺
- NRP 之后的冗余 token:获得 r₀ − α·(Lᵢ/L_max) 的较低奖励
- 答案结论 token:始终获得非负优势
这确保冗余 token 始终获得负优势值,通过自回归生成的特性,一旦第一个冗余 token 被抑制,后续冗余也随之消除。
3. 课程 Prompt 调度(§4.3)
自适应调整批次中简单 prompt 的比例 κ:
κ_m = clip(κ_{m-1} + β(R_m - R_{m-1}), 0, κ⁰_m)
随着冗余比例下降,逐步增加简单 prompt 的比例,避免过度抑制探索行为,满足定理 1 的条件。
实验结果
主要结果
| 模型 | Token 减少 | Pass@1 变化 | AES |
|---|---|---|---|
| DeepSeek-R1-Distill-1.5B | 57.17% | +2.48 | 0.74 |
| DeepSeek-R1-Distill-7B | 49.50% | +0.80 | 0.54 |
| Qwen3-4B | 54.80% | +1.32 | 0.61 |
关键发现
- 在 7 个基准(MATH500、AIME2024/2025、AMC23、OlympiadBench、GPQA-Diamond、LiveCodeBench)上减少超过 50% 的推理 token,同时保持或提升准确率
- 尽管仅在数学数据上训练,仍能泛化到科学(GPQA-D 减少 56.33%)和编程(LCB 减少 33.52%)任务
- Pass@K 曲线与基础模型几乎完全重合,证明探索能力未受损
- 压缩效果在所有难度级别上保持一致
消融实验
- 去除课程调度:性能明显下降(验证定理 1)
- 去除解耦奖励:约 25% 的过度思考 token 残留(验证定理 2)
- 两个组件互补且缺一不可
核心洞察
- 序列级长度惩罚与 token 级优化之间存在根本性错位
- 高熵 token 是有效推理的关键,不应被一刀切地惩罚
- 通过精确识别 NRP 边界并解耦奖励,可以在不损害推理能力的前提下大幅提升效率
- 课程调度提供了稳定训练的保障,防止探索能力退化
实验配置
- 训练集:DeepScaleR
- 训练框架:veRL
- 硬件:4×NVIDIA A100 80GB
- 超参数:r⁺=1.1, r₀=1.0, β=0.2, 每个 prompt 16 rollouts