Agent Reliability Evidence Grounding Benchmarking Security
摘要

大型语言模型智能体日益依赖暴露文件、网页及 API 的环境支架,但这些观察结果的可靠性常存疑。现有基准测试多关注任务能力或特定攻击,却忽视了智能体在面临过时、错误或恶意观测时能否基于真实环境状态进行 grounded 推理这一根本问题。本文提出 EnvTrustBench,旨在基准测试“证据落地缺陷”(EGD),即智能体未核实当前证据便盲目行动的行为失败。通过在多种场景和模型上的评估,结果显示 EGD 普遍存在,凸显了环境落地作为智能体可靠性与安全核心问题的重要性。

AI 推荐理由

论文核心研究 Agent 对环境证据的推理与验证机制,评估其在信息不可靠时的判断能力。

研究机构
The University of Sydney Sydney, Australia Nanjing University Jiangsu, China
论文信息
作者 Strick Sheng, Ziyue Wang, Liyi Zhou
发布日期 2026-05-09
arXiv ID 2605.08828
相关性评分 8/10 (高度相关)