摘要
上下文强化学习(ICRL)使大语言模型能在上下文窗口内直接利用外部奖励进行在线学习,但其面临推理时缺乏真实标签导致奖励估计困难的核心挑战。为此,本文提出 TR-ICRL 框架,适用于推理及知识密集型任务。该方法首先检索未标记评估集中的相关实例,通过多数投票生成伪标签作为奖励代理,引导模型迭代优化并生成形成性反馈。最终将合成的上下文信息与原始查询整合,经再次投票得出答案。实验表明,该方法在 MedQA 和 AIME2024 等主流推理任务上显著提升了模型性能。
AI 推荐理由
论文核心解决推理任务中的奖励估计难题,通过测试时重思考机制显著提升逻辑与知识推理能力。
研究机构
The Hong Kong Polytechnic University
Institute of Computing Technology, Chinese Academy of Sciences
East China Normal University
Northeastern University
论文信息