摘要
本文提出了一种后训练语言模型的框架,旨在鼓励乐观探索并促进探索与利用的协同。核心思想是训练模型生成一组在奖励函数下整体准确且在推理策略上具有探索性的响应。首先,开发了在任意目标函数下利用集合强化学习优化语言模型的通用方法,展示了如何通过修改优势计算来适配标准 RL 算法。随后,提出了多色探索策略优化(Poly-EPO),实例化了该框架以显式协同探索与利用。实验表明,Poly-EPO 在多个推理基准上提高了泛化能力,增加了生成多样性,并有效随测试时计算量扩展。
AI 推荐理由
论文核心在于通过集合强化学习训练模型生成多样化的推理策略,直接提升推理泛化能力。
研究机构
Stanford University
论文信息