Multi-Robot Systems Spatial Reasoning Multimodal LLM Cooperative Perception
摘要

多模态大语言模型在自我中心视频理解方面进展显著,但其多具身视角下的协作推理能力尚待探索。本文通过多机器人协作动态空间推理任务进行研究,要求模型整合同步的自我中心视频以回答空间、时间及协调性问题。为此,我们推出了首个基准 CoopSR 及包含超 11 万问答对的数据集 EgoTeam。此外,提出了 SP-CoR 框架,结合动态感知采样、谱与物理引导的视图融合及提示蒸馏技术。实验表明,该方法在多个基准上显著提升了协作推理性能,并展现出优异的泛化能力。

AI 推荐理由

论文核心研究多机器人协作下的空间推理能力,提出专用框架解决多视角整合与逻辑推断问题。

研究机构
Karlsruhe Institute of Technology INSAlT, Sofia University Sofia University St. Kliment Ohridski Hunan University University of Oxford Zhejiang University ETH Zurich 'Ant Group
论文信息
作者 Kunyu Peng, Zhikun Zhou, Kailun Yang, Di Wen, Ruiping Liu et al.
发布日期 2026-05-18
arXiv ID 2605.18431
相关性评分 9/10 (高度相关)