摘要
强化学习虽能提升大语言模型的推理能力,但存在成本高和样本效率低的问题。现有难度感知数据选择方法存在估计不准、性能增益有限等缺陷。为此,本文提出 DARE 框架,通过自归一化重要性采样协同演化难度估计与策略,利用对称 Beta 分布维持难度覆盖多样性,并针对不同难度层级应用自适应计算分配策略。实验表明,DARE 在训练效率、最终效果及推理效率上均优于现有方法,实现了简单任务响应更简洁、困难任务正确率更高。
AI 推荐理由
论文核心旨在通过强化学习提升 LLM 的推理能力,解决样本效率问题。
研究机构
Rutgers University
Amazon
Washington University
Google
论文信息