摘要
任务完成率是衡量 LLM Agent 能力的标准代理指标,但完成率相同的模型在跟踪中间状态的能力上可能存在显著差异。本文提出了工作记忆保真度 - 主动操作(WMF-AM),这是一种经过校准的无草稿纸探针,用于评估累积算术状态跟踪能力。我们在 20 个开源模型上对其进行了评估,并结合确定性代理测试套件进行分析。结果显示,WMF-AM 能有效预测代理性能,且该信号在控制完成分和模型规模后依然显著。消融实验表明,负载下的累积状态跟踪是主要难点,而非单步算术或实体跟踪。
AI 推荐理由
论文核心研究累积状态跟踪与工作记忆保真度,直接关联 Agent 记忆机制。
研究机构
东京大学
得克萨斯农工大学
拉普兰特-拉哈蒂技术大学
伍斯特理工学院
论文信息