摘要
现有工具使用语言 Agent 的评估基准常假设理想环境,忽视了真实部署中的输入错误、API 故障等噪声。本文将这些失效建模为部分可观测马尔可夫决策过程(POMDP)中的模拟到现实差距,并提出包含 22 种扰动类型的 RobustBench-TC 基准。实验表明模型对奖励相关及转移扰动极为敏感。为此,作者提出 ToolRL-DR,一种基于域随机化的强化学习方案,通过在增强扰动轨迹上训练,显著提升了 Agent 在未见过的运行时故障中的鲁棒性,缩小了与顶尖闭源模型的差距。
AI 推荐理由
论文核心研究工具使用 Agent 在噪声环境下的鲁棒性及强化学习训练方法。
研究机构
Arizona State University
University of Southern California
University of Pennsylvania
Carnegie Mellon University
Adobe Research
论文信息