Reinforcement Learning Causal Inference Long-Horizon Reasoning Agent Reliability
摘要

针对长程语言代理在强化学习中出现的证据链 unsupported、信念漂移及捷径行为问题,本文提出 CVT-RL 算法。该方法引入密集可验证奖励、干预有效性门控及策略条件反事实贡献估计器,通过删除、语义替换等受控干预评估步骤对最终成功的因果贡献。实验表明,CVT-RL 在多项长程任务中显著提升了成功率与证据质量,有效减少了模型作弊行为,为构建更可靠的长程推理代理提供了可复现路径。

AI 推荐理由

论文核心解决长程推理中的证据链断裂与信念漂移,通过反事实归因提升推理可靠性。

研究机构
R32314095@stu.ahu.edu.cn
论文信息
作者 Renwei Meng
发布日期 2026-06-03
arXiv ID 2606.05263
相关性评分 9/10 (高度相关)