Reinforcement Learning Reasoning Data Selection Large Reasoning Models
摘要

强化学习微调是增强大语言模型推理能力的关键技术,但其效果高度依赖训练数据选择。现有在线提示选择方法虽能加速训练,却因需大量 rollout 产生高昂计算开销。本文提出动态预测采样(DPS),通过将解题进程建模为动态系统并利用隐马尔可夫模型,基于历史奖励信号进行在线贝叶斯推断,从而在无需昂贵 rollout 的情况下预测并选择高信息量提示。实验表明,DPS 显著减少冗余计算,加速训练并提升数学、规划等任务的推理性能。

AI 推荐理由

论文核心目标是提升大模型的推理能力,提出动态预测采样方法优化 RL 微调过程。

研究机构
太原理工大学自动化系
论文信息
作者 Yixiu Mao, Yun Qu, Qi Wang, Heming Zou, Xiangyang Ji
发布日期 2026-03-11
arXiv ID 2603.10887
相关性评分 9/10 (高度相关)