social deduction multimodal reasoning hallucination detection agent evaluation grounding
摘要

社交推理游戏已成为探测大语言模型智能体推理、欺骗、协调及信念建模能力的热门测试床。然而,现有环境多仅依据胜率等结果评分且局限于文本交互,难以判断agent 语言是否基于其感知与行动,亦难识别行为失效模式。为此,本文提出 QUACK,一个用于审计多模态社交推理中语言 grounding 的开源环境与评估框架。该框架从游戏结果、行为轨迹及话语一致性三个层面评估智能体,其核心陈述验证流水线通过重构真实轨迹并核对讨论主张,自动标记空间幻觉、无据指控等问题。实验发现即使是前沿模型也存在显著幻觉与无据指控现象。

AI 推荐理由

论文核心在于评估多模态社交推理中的语言 grounding,检测幻觉与逻辑不一致,属推理能力研究。

研究机构
麦吉尔大学 米拉-魁北克人工智能研究所 剑桥大学 MBZUAI 穆罕默德本扎耶德人工智能大学 多伦多大学
论文信息
作者 Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu et al.
发布日期 2026-05-26
arXiv ID 2605.27068
相关性评分 9/10 (高度相关)