Tool Use Robustness Reinforcement Learning Sim-to-Real Benchmark
摘要

现有工具使用语言 Agent 的评估基准常假设理想环境,忽视了真实部署中的输入错误、API 故障等噪声。本文将这些失效建模为部分可观测马尔可夫决策过程(POMDP)中的模拟到现实差距,并提出包含 22 种扰动类型的 RobustBench-TC 基准。实验表明模型对奖励相关及转移扰动极为敏感。为此,作者提出 ToolRL-DR,一种基于域随机化的强化学习方案,通过在增强扰动轨迹上训练,显著提升了 Agent 在未见过的运行时故障中的鲁棒性,缩小了与顶尖闭源模型的差距。

AI 推荐理由

论文核心研究工具使用 Agent 在噪声环境下的鲁棒性及强化学习训练方法。

研究机构
Arizona State University University of Southern California University of Pennsylvania Carnegie Mellon University Adobe Research
论文信息
作者 Xiaolin Zhou, Aojie Yuan, Zheng Luo, Zipeng Ling, Xixiao Pan et al.
发布日期 2026-05-12
arXiv ID 2605.11928
相关性评分 9/10 (高度相关)