摘要
强化学习微调是增强大语言模型推理能力的关键技术,但其效果高度依赖训练数据选择。现有在线提示选择方法虽能加速训练,却因需大量 rollout 产生高昂计算开销。本文提出动态预测采样(DPS),通过将解题进程建模为动态系统并利用隐马尔可夫模型,基于历史奖励信号进行在线贝叶斯推断,从而在无需昂贵 rollout 的情况下预测并选择高信息量提示。实验表明,DPS 显著减少冗余计算,加速训练并提升数学、规划等任务的推理性能。
AI 推荐理由
论文核心目标是提升大模型的推理能力,提出动态预测采样方法优化 RL 微调过程。
研究机构
太原理工大学自动化系
论文信息