摘要
基于大语言模型的多智能体系统在长程任务中常因单点错误导致级联失败。现有研究多为事后归因,无法在任务执行中干预。本文提出 AgentForesight 框架,将问题重构为在线审计:仅凭当前轨迹前缀判断是否出现决定性错误。我们构建了包含编码、数学等领域的 AFTraj-2K 数据集,并训练了 AgentForesight-7B 模型。该模型采用由粗到细的强化学习策略,能精准定位错误步骤。实验表明,其在多个基准上优于 GPT-4.1 等主流模型,实现了从死后检测到时中干预的转变。
AI 推荐理由
论文聚焦多智能体长程任务中的早期失败预测与干预,直接关联任务规划的执行监控与纠错。
研究机构
Rutgers University
The University of Texas at Austin
Purdue University
论文信息