摘要
理解社交互动需基于细微的非语言线索进行推理,但当前多模态大模型常难以识别多人视频中的交互对象。本文提出 GRASP,一个大规模社交推理数据集,将高层社交问答与细粒度注视及指示手势事件相连。该数据集包含 46K 视频(共 749 小时)生成的 29 万问答对,涵盖注视、手势及其联合推理的 16 类分类体系。此外,提出社交落地奖励(SGR),利用这些社交事件激励模型推理交互参与者。实验表明,SGR 在提升 GRASP-Bench 性能的同时,保持了在相关社交视频 QA 基准上的零样本表现。
AI 推荐理由
论文核心研究多模态社交推理,提出新数据集与奖励机制以提升非语言线索推理能力。
研究机构
University of Illinois Urbana-Champaign
Georgia Institute of Technology
论文信息