摘要
基于结果奖励的强化学习在训练大语言模型处理复杂推理任务上成效显著。然而,在需策略性提问获取信息的主动推理场景中,代理常陷入“信息自锁”:停止提出有效问题且难以内化已有信息。本文将主动推理分解为动作选择与信念追踪两大核心能力,指出二者缺陷会导致探索不足并形成恶性循环。为此,作者提出一种通过注入简易方向性批评来重新分配学习信号的方法。实验表明,该方法显著缓解信息自锁,性能提升高达 60%。
AI 推荐理由
论文核心解决主动推理中的信息自锁问题,直接提升 LLM 代理的推理能力。
研究机构
中国科学院自动化研究所
论文信息