Benchmark Agent Planning Personal Context Tool Use Evaluation
摘要

下一代 AI 需管理海量个人数据、多样工具及多步推理,但现有基准多缺乏语境且仅限单轮交互。本文提出 ASTRA-bench,这是一个独特融合时间演进个人语境、交互式工具箱及复杂用户意图的基准测试。通过事件驱动流程,基于纵向生活事件生成 2413 个场景,并按参考、功能及信息复杂度标注。对最先进模型的评估显示,高复杂度下性能显著下降,论证生成是主要瓶颈。研究揭示了当前 Agent 在混乱个人语境中落地推理及编排可靠多步计划的关键局限。

AI 推荐理由

论文核心评估 Agent 在复杂个人语境下的多步推理与行动规划能力,规划是关键瓶颈。

研究机构
Desiderata 清华大学
论文信息
作者 Zidi Xiu, David Q. Sun, Kevin Cheng, Maitrik Patel, Josh Date et al.
发布日期 2026-03-02
arXiv ID 2603.01357
相关性评分 9/10 (高度相关)