Social Reasoning Multimodal LLM Non-verbal Interaction Dataset Reinforcement Learning
摘要

理解社交互动需基于细微的非语言线索进行推理,但当前多模态大模型常难以识别多人视频中的交互对象。本文提出 GRASP,一个大规模社交推理数据集,将高层社交问答与细粒度注视及指示手势事件相连。该数据集包含 46K 视频(共 749 小时)生成的 29 万问答对,涵盖注视、手势及其联合推理的 16 类分类体系。此外,提出社交落地奖励(SGR),利用这些社交事件激励模型推理交互参与者。实验表明,SGR 在提升 GRASP-Bench 性能的同时,保持了在相关社交视频 QA 基准上的零样本表现。

AI 推荐理由

论文核心研究多模态社交推理,提出新数据集与奖励机制以提升非语言线索推理能力。

研究机构
University of Illinois Urbana-Champaign Georgia Institute of Technology
论文信息
作者 Junho Kim, Xu Cao, Houze Yang, Bikram Boote, Ana Jojic et al.
发布日期 2026-05-15
arXiv ID 2605.15764
相关性评分 9/10 (高度相关)