摘要
现有智能体基准存在环境交互开销大及任务视野与难度分布不均的问题。为此,本文提出 ACE-Bench,基于统一的网格规划任务,要求智能体在局部与全局约束下填充隐藏槽位。该基准通过隐藏槽位数量控制可扩展视野,利用干扰项预算调节可控难度。其轻量级环境设计通过静态 JSON 解析工具调用,消除了设置开销,实现了快速可复现的评估。实验涵盖 13 种模型与 6 个领域,证实了该基准在智能体推理评估中的可解释性与可控性。
AI 推荐理由
论文提出基于网格规划任务的基准,核心在于评估代理的可扩展视野与可控难度下的规划能力。
研究机构
Case Western Reserve University
NII LLMC (Japan)
University of Zurich
论文信息