RLVR Prompt Optimization Reasoning Policy Optimization
摘要

可验证奖励的强化学习(RLVR)是提升大语言模型推理能力的有效范式,但在面对高难度样本时存在探索效率低下的问题。为此,本文提出 P^2O 框架,协同提示优化与策略优化。该框架利用遗传帕累托算法演化提示模板,引导模型发现成功轨迹,并将由此获得的推理增益蒸馏至模型参数中。这种方法为困难样本提供了更密集的监督信号,加速了收敛。实验表明,P^2O 不仅在分布内数据集上表现优异,在分布外基准测试中也展现出强大的泛化能力。

AI 推荐理由

论文核心旨在通过联合优化策略与提示,解决大模型在复杂推理任务中的探索效率问题。

研究机构
中国科学院大学 清华大学
论文信息
作者 Xinyu Lu, Kaiqi Zhang, Jinglin Yang, Boxi Cao, Yaojie Lu et al.
发布日期 2026-03-23
arXiv ID 2603.21877
相关性评分 9/10 (高度相关)