Reinforcement Learning Reasoning Efficiency Difficulty Estimation
摘要

强化学习虽能提升大语言模型的推理能力,但存在成本高和样本效率低的问题。现有难度感知数据选择方法存在估计不准、性能增益有限等缺陷。为此,本文提出 DARE 框架,通过自归一化重要性采样协同演化难度估计与策略,利用对称 Beta 分布维持难度覆盖多样性,并针对不同难度层级应用自适应计算分配策略。实验表明,DARE 在训练效率、最终效果及推理效率上均优于现有方法,实现了简单任务响应更简洁、困难任务正确率更高。

AI 推荐理由

论文核心旨在通过强化学习提升 LLM 的推理能力,解决样本效率问题。

研究机构
Rutgers University Amazon Washington University Google
论文信息
作者 Yang Zhou, Can Jin, Zihan Dong, Zhepeng Wang, Yanting Yang et al.
发布日期 2026-05-09
arXiv ID 2605.09188
相关性评分 9/10 (高度相关)