因果归因 自我修复 反事实推理 Agent 进化 偏好优化
摘要

大型语言模型代理在多步任务中常因推理或工具使用失败。本文提出 CausalFlow,一种干预框架,将失败轨迹转化为最小反事实修复和可复用监督信号。该方法通过步骤级反事实干预计算因果责任分数,定位致败步骤并生成最小化修正,构建对比数据对。CausalFlow 支持测试时针对性修复及训练时偏好优化监督。实验表明,其在数学推理、代码生成等基准上优于启发式方法,能有效将失败转化为可靠性提升与学习资源。

AI 推荐理由

论文提出基于因果归因的自我修复框架,将失败转化为训练信号,核心在于 Agent 的自我改进与进化。

研究机构
Department of Computer Science, University of California, Davis, Davis, CA 95616
论文信息
作者 Akash Bonagiri, Devang Borkar, Gerard Janno Anderias, Setareh Rafatirad, Houman Homayoun
发布日期 2026-05-25
arXiv ID 2605.25338
相关性评分 9/10 (高度相关)