Working Memory State Tracking Agent Evaluation LLM Benchmark
摘要

任务完成率是衡量 LLM Agent 能力的标准代理指标,但完成率相同的模型在跟踪中间状态的能力上可能存在显著差异。本文提出了工作记忆保真度 - 主动操作(WMF-AM),这是一种经过校准的无草稿纸探针,用于评估累积算术状态跟踪能力。我们在 20 个开源模型上对其进行了评估,并结合确定性代理测试套件进行分析。结果显示,WMF-AM 能有效预测代理性能,且该信号在控制完成分和模型规模后依然显著。消融实验表明,负载下的累积状态跟踪是主要难点,而非单步算术或实体跟踪。

AI 推荐理由

论文核心研究累积状态跟踪与工作记忆保真度,直接关联 Agent 记忆机制。

研究机构
东京大学 得克萨斯农工大学 拉普兰特-拉哈蒂技术大学 伍斯特理工学院
论文信息
作者 Dengzhe Hou, Lingyu Jiang, Deng Li, Zirui Li, Fangzhou Lin et al.
发布日期 2026-03-28
arXiv ID 2603.27343
相关性评分 9/10 (高度相关)