摘要
随着大语言模型成为对话系统核心,其推理对话伙伴意图与状态的心智理论(ToM)能力对安全交互至关重要。本文提出“信念引导心智理论”(ToM-SB)挑战,要求防御者作为双重代理,在共享宇宙中利用部分先验知识误导攻击者。研究发现前沿模型在此任务上表现不佳,即使使用 ToM 提示亦然。为此,作者利用强化学习训练模型,发现欺骗成功与 ToM 能力之间存在双向涌现关系:单一奖励即可提升另一项能力。结合两者奖励的代理在困难场景下显著优于现有前沿模型,并展现出良好的泛化性。
AI 推荐理由
论文核心研究心智理论(ToM)推理机制,通过强化学习提升模型对他人信念的建模与推理能力。
研究机构
UNC Chapel Hill
University of Texas at Austin
论文信息