摘要
可验证奖励的强化学习(RLVR)是提升大语言模型推理能力的有效范式,但在面对高难度样本时存在探索效率低下的问题。为此,本文提出 P^2O 框架,协同提示优化与策略优化。该框架利用遗传帕累托算法演化提示模板,引导模型发现成功轨迹,并将由此获得的推理增益蒸馏至模型参数中。这种方法为困难样本提供了更密集的监督信号,加速了收敛。实验表明,P^2O 不仅在分布内数据集上表现优异,在分布外基准测试中也展现出强大的泛化能力。
AI 推荐理由
论文核心旨在通过联合优化策略与提示,解决大模型在复杂推理任务中的探索效率问题。
研究机构
中国科学院大学
清华大学
论文信息