摘要
社交推理游戏已成为探测大语言模型智能体推理、欺骗、协调及信念建模能力的热门测试床。然而,现有环境多仅依据胜率等结果评分且局限于文本交互,难以判断agent 语言是否基于其感知与行动,亦难识别行为失效模式。为此,本文提出 QUACK,一个用于审计多模态社交推理中语言 grounding 的开源环境与评估框架。该框架从游戏结果、行为轨迹及话语一致性三个层面评估智能体,其核心陈述验证流水线通过重构真实轨迹并核对讨论主张,自动标记空间幻觉、无据指控等问题。实验发现即使是前沿模型也存在显著幻觉与无据指控现象。
AI 推荐理由
论文核心在于评估多模态社交推理中的语言 grounding,检测幻觉与逻辑不一致,属推理能力研究。
研究机构
麦吉尔大学
米拉-魁北克人工智能研究所
剑桥大学
MBZUAI
穆罕默德本扎耶德人工智能大学
多伦多大学
论文信息