World Models Backdoor Attack Long-horizon Planning Agent Security
摘要

世界模型通过生成和评估想象轨迹实现长程规划,但也引入了新的安全风险。现有后门攻击难以影响具备动态先验的世界模型。本文发现世界模型存在基于想象轨迹长尾排序结构的独特漏洞。为此,提出 TRAP 框架,利用尾感知排序损失聚焦关键决策轨迹,结合双重门控机制稳定优化。实验表明,TRAP 能在触发条件下改变轨迹排序,系统性劫持规划过程并导致性能显著下降,凸显了对该类智能体进行安全评估的必要性。

AI 推荐理由

论文核心针对世界模型的长程规划机制,通过攻击想象轨迹排序来劫持规划结果。

研究机构
苏州大学计算机科学与技术学院
论文信息
作者 Siyuan Duan, Ke Zhang, Xizhao Luo
发布日期 2026-05-03
arXiv ID 2605.01950
相关性评分 9/10 (高度相关)