摘要
大语言模型在多轮交互中因上下文演变易受提示注入和上下文投毒攻击,导致推理轨迹扭曲。现有防御多忽略跨轮次上下文演化。为此,本文提出博弈论安全模型上下文协议(GT-MCP),一种控制器驱动的多智能体方法,将上下文管理视为闭环动态过程。该方法协调三个异构智能体,通过信任函数评估因果一致性、语义一致性及分布漂移,并在检测到不稳定时利用回滚自愈机制恢复有效上下文。实验表明,该方法在自适应对抗威胁下能有效限制上下文漂移,保持推理稳定性。
AI 推荐理由
论文核心解决多轮交互中的上下文推理鲁棒性问题,提出博弈论机制防御推理轨迹扭曲。
研究机构
蒙特利尔大学
论文信息