Spatial Reasoning Multi-Agent Systems Reinforcement Learning Embodied AI
摘要

针对具身多智能体系统从分布式局部视角理解世界的挑战,本文提出 Ego-to-World (E2W) 基准,评估视觉语言模型融合异构视角的能力。为此,作者设计了 CoRL 框架,结合思维链监督微调与基于组相对策略优化的强化学习。其核心组件跨视角空间奖励(CVSR)通过将推理步骤与视觉证据关联,提供密集反馈以确保实体解析一致性。实验表明,CoRL 在推理与感知接地指标上显著优于现有基线,并能泛化至外部基准及真实多机器人操作任务,为从自我中心观测学习世界中心场景理解奠定了基础。

AI 推荐理由

论文核心解决多视角空间推理挑战,提出结合思维链与强化学习的框架。

研究机构
上海交通大学 清华大学 北京邮电大学 牛津大学 复旦大学 山东大学
论文信息
作者 Heng Zhou, Li Kang, Yiran Qin, Xiufeng Song, Ao Yu et al.
发布日期 2026-03-16
arXiv ID 2603.14811
相关性评分 9/10 (高度相关)