Reinforcement Learning Multi-turn Interaction Contextual Inertia Reasoning Stability
摘要

大型语言模型在单轮交互中表现优异,但在信息逐步揭示的多轮场景中常因“上下文惯性”而失败,即固守过往错误推理路径,忽视新约束。为此,本文提出 RLSTA 方法,利用模型强大的单轮能力作为稳定内部锚点生成奖励信号,引导多轮响应与最新信息对齐。实验表明,该方法显著优于标准微调,具备跨领域泛化能力,无需外部验证器即可实现自我校准,有效提升了多轮交互中的动态推理稳定性。

AI 推荐理由

论文核心解决多轮交互中的推理僵化问题,通过新机制提升动态推理能力。

研究机构
香港大学计算机与数据科学学院
论文信息
作者 Xingwu Chen, Zhanqiu Zhang, Yiwen Guo, Difan Zou
发布日期 2026-03-05
arXiv ID 2603.04783
相关性评分 9/10 (高度相关)