摘要
多模态大语言模型在自我中心视频理解方面进展显著,但其多具身视角下的协作推理能力尚待探索。本文通过多机器人协作动态空间推理任务进行研究,要求模型整合同步的自我中心视频以回答空间、时间及协调性问题。为此,我们推出了首个基准 CoopSR 及包含超 11 万问答对的数据集 EgoTeam。此外,提出了 SP-CoR 框架,结合动态感知采样、谱与物理引导的视图融合及提示蒸馏技术。实验表明,该方法在多个基准上显著提升了协作推理性能,并展现出优异的泛化能力。
AI 推荐理由
论文核心研究多机器人协作下的空间推理能力,提出专用框架解决多视角整合与逻辑推断问题。
研究机构
Karlsruhe Institute of Technology
INSAlT, Sofia University
Sofia University
St. Kliment Ohridski
Hunan University
University of Oxford
Zhejiang University
ETH Zurich
'Ant Group
论文信息