Benchmark Agent Evaluation Commitment Integrity Memory Consistency
摘要

本文提出 NeuroState-Bench,这是一个经人工校准的基准,旨在通过预定义的侧向查询探针而非推断隐藏激活,来操作化评估 LLM Agent 在多轮任务中的“承诺完整性”。该基准包含 144 个确定性任务和 306 个探针,涵盖八类认知失败模式。实验表明,任务成功率与承诺完整性存在显著分歧:两者排名不一致,且完整性排名在干扰下更稳定。提出的 HCCIS-CORE 评分在诊断终端任务失败方面表现优异,为暴露模型承诺失效提供了新的校准评估维度。

AI 推荐理由

论文核心研究 Agent 在多轮任务中保持承诺完整性的记忆状态机制,提出基准评估记忆一致性。

研究机构
School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen
论文信息
作者 Jia Xiao
发布日期 2026-05-03
arXiv ID 2605.01847
相关性评分 9/10 (高度相关)