Multi-Agent Systems Failure Prediction Online Auditing Reinforcement Learning
摘要

基于大语言模型的多智能体系统在长程任务中常因单点错误导致级联失败。现有研究多为事后归因,无法在任务执行中干预。本文提出 AgentForesight 框架,将问题重构为在线审计:仅凭当前轨迹前缀判断是否出现决定性错误。我们构建了包含编码、数学等领域的 AFTraj-2K 数据集,并训练了 AgentForesight-7B 模型。该模型采用由粗到细的强化学习策略,能精准定位错误步骤。实验表明,其在多个基准上优于 GPT-4.1 等主流模型,实现了从死后检测到时中干预的转变。

AI 推荐理由

论文聚焦多智能体长程任务中的早期失败预测与干预,直接关联任务规划的执行监控与纠错。

研究机构
Rutgers University The University of Texas at Austin Purdue University
论文信息
作者 Boxuan Zhang, Jianing Zhu, Zeru Shi, Dongfang Liu, Ruixiang Tang
发布日期 2026-05-09
arXiv ID 2605.08715
相关性评分 8/10 (高度相关)