In-Context Reinforcement Learning Reasoning Enhancement Test-Time Computation Pseudo-labeling
摘要

上下文强化学习(ICRL)使大语言模型能在上下文窗口内直接利用外部奖励进行在线学习,但其面临推理时缺乏真实标签导致奖励估计困难的核心挑战。为此,本文提出 TR-ICRL 框架,适用于推理及知识密集型任务。该方法首先检索未标记评估集中的相关实例,通过多数投票生成伪标签作为奖励代理,引导模型迭代优化并生成形成性反馈。最终将合成的上下文信息与原始查询整合,经再次投票得出答案。实验表明,该方法在 MedQA 和 AIME2024 等主流推理任务上显著提升了模型性能。

AI 推荐理由

论文核心解决推理任务中的奖励估计难题,通过测试时重思考机制显著提升逻辑与知识推理能力。

研究机构
The Hong Kong Polytechnic University Institute of Computing Technology, Chinese Academy of Sciences East China Normal University Northeastern University
论文信息
作者 Wenxuan Jiang, Yuxin Zuo, Zijian Zhang, Xuecheng Wu, Zining Fan et al.
发布日期 2026-04-01
arXiv ID 2604.00438
相关性评分 9/10 (高度相关)