摘要
大型语言模型智能体日益依赖暴露文件、网页及 API 的环境支架,但这些观察结果的可靠性常存疑。现有基准测试多关注任务能力或特定攻击,却忽视了智能体在面临过时、错误或恶意观测时能否基于真实环境状态进行 grounded 推理这一根本问题。本文提出 EnvTrustBench,旨在基准测试“证据落地缺陷”(EGD),即智能体未核实当前证据便盲目行动的行为失败。通过在多种场景和模型上的评估,结果显示 EGD 普遍存在,凸显了环境落地作为智能体可靠性与安全核心问题的重要性。
AI 推荐理由
论文核心研究 Agent 对环境证据的推理与验证机制,评估其在信息不可靠时的判断能力。
研究机构
The University of Sydney
Sydney, Australia
Nanjing University
Jiangsu, China
论文信息