摘要
本文提出 NeuroState-Bench,这是一个经人工校准的基准,旨在通过预定义的侧向查询探针而非推断隐藏激活,来操作化评估 LLM Agent 在多轮任务中的“承诺完整性”。该基准包含 144 个确定性任务和 306 个探针,涵盖八类认知失败模式。实验表明,任务成功率与承诺完整性存在显著分歧:两者排名不一致,且完整性排名在干扰下更稳定。提出的 HCCIS-CORE 评分在诊断终端任务失败方面表现优异,为暴露模型承诺失效提供了新的校准评估维度。
AI 推荐理由
论文核心研究 Agent 在多轮任务中保持承诺完整性的记忆状态机制,提出基准评估记忆一致性。
研究机构
School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen
论文信息