摘要
大型语言模型在推理任务中受益于监督微调和可验证奖励的强化学习,但在指令式分子优化中表现不佳,因缺乏逐步优化轨迹。本文揭示仅对参考分子进行答案监督会导致推理能力坍塌,而强化学习因探索不足导致反馈稀疏。为此,提出参考引导策略优化(RePO),该方法无需轨迹数据,通过采样候选分子及其中间推理轨迹,结合衡量属性满足度的可验证奖励进行强化学习训练,同时利用参考分子引导中间推理轨迹作为上下文,仅以监督方式训练答案部分。实验表明,RePO 在多个基准上优于现有基线,有效平衡了探索与利用。
AI 推荐理由
论文核心在于利用 LLM 推理轨迹进行分子优化,解决无轨迹数据下的推理坍塌问题。
研究机构
香港浸会大学
上海交通大学
胡润实验室
达摩院,阿里巴巴集团
论文信息