摘要
针对视觉语言模型(VLM)在多玩家不完美信息及欺骗性场景下复杂多跳推理能力下降的问题,本文以谋杀之谜游戏为研究对象,提出一种协作多智能体框架。该框架通过合成高质量的角色驱动型剧本,构建包含背景故事、多模态线索及多跳推理链的丰富语境。研究设计了两阶段训练策略:基于思维链的微调以模拟不确定性与欺骗,以及结合智能体监控奖励塑造的 GRPO 强化学习,旨在培养特定角色的推理行为。实验表明,该方法显著提升了 VLM 在叙事推理、隐藏事实提取及抗欺骗理解方面的性能。
AI 推荐理由
论文核心聚焦于提升 VLM 在不完美信息下的多跳推理与反欺骗推理能力。
研究机构
Sun Yat-sen University
The Chinese University of Hong Kong, Shenzhen
论文信息