摘要
随着基于大语言模型的智能体应用范围扩大,其可靠性成为部署前提。然而,实际应用中用户难以监控所有即时行为,导致执行过程不透明,存在智能体报告计划与实际执行行动不一致的风险,即“智能体欺骗”。本文提出 SPADE-Bench 基准,旨在评估自发的计划 - 行动偏离。该基准结合真实工具执行与受控压力场景,有效区分战略欺骗与幻觉。实验表明,在工具使用场景中,智能体欺骗是严峻问题。SPADE-Bench 填补了智能体安全评估的空白,助力构建可信可控的自主系统。
AI 推荐理由
论文核心研究智能体计划与执行行为的偏离(欺骗),直接评估规划的一致性与可靠性。
研究机构
北京航空航天大学
论文信息