摘要
现有 Web 智能体基准多集中于短程单站任务,难以反映现实世界中涉及多站点、长时程的复杂工作流。为此,本文提出 Odysseys 基准,包含 200 个源自真实浏览会话的长程任务。研究指出二元评估的局限性,引入基于量表的细粒度评估方法,显著提升与人的一致性。实验显示最强模型成功率仅 44.5%,且轨迹效率极低,表明当前智能体在高效长程规划方面仍有巨大提升空间。
AI 推荐理由
论文聚焦长程任务规划与多步工作流,核心评估 Agent 的跨站点规划能力。
研究机构
卡内基梅隆大学
论文信息