摘要
随着大语言模型演变为能自主调用工具和进行复杂推理的智能体系统,传统的奖励建模范式面临挑战,尤其是缺乏针对工具集成环境的评估基准。为此,本文提出 Plan-RewardBench,一个轨迹级偏好基准,旨在评估判别器在复杂工具使用场景中区分优选与干扰智能体轨迹的能力。该基准涵盖安全拒绝、工具无关性、复杂规划及鲁棒错误恢复四类任务。实验表明,现有评估器在长程轨迹上性能显著下降,凸显了面向智能体的轨迹级奖励建模专用训练的必要性。
AI 推荐理由
论文核心关注智能体在复杂工具使用场景下的轨迹级规划评估与奖励建模。
研究机构
State Key Laboratory of Novel Software Technology, Nanjing University
School of Intelligence Science and Technology, Nanjing University
AMAP, Alibaba Group
论文信息