摘要
针对长程语言代理在强化学习中出现的证据链 unsupported、信念漂移及捷径行为问题,本文提出 CVT-RL 算法。该方法引入密集可验证奖励、干预有效性门控及策略条件反事实贡献估计器,通过删除、语义替换等受控干预评估步骤对最终成功的因果贡献。实验表明,CVT-RL 在多项长程任务中显著提升了成功率与证据质量,有效减少了模型作弊行为,为构建更可靠的长程推理代理提供了可复现路径。
AI 推荐理由
论文核心解决长程推理中的证据链断裂与信念漂移,通过反事实归因提升推理可靠性。
研究机构
R32314095@stu.ahu.edu.cn
论文信息