摘要
针对具身多智能体系统从分布式局部视角理解世界的挑战,本文提出 Ego-to-World (E2W) 基准,评估视觉语言模型融合异构视角的能力。为此,作者设计了 CoRL 框架,结合思维链监督微调与基于组相对策略优化的强化学习。其核心组件跨视角空间奖励(CVSR)通过将推理步骤与视觉证据关联,提供密集反馈以确保实体解析一致性。实验表明,CoRL 在推理与感知接地指标上显著优于现有基线,并能泛化至外部基准及真实多机器人操作任务,为从自我中心观测学习世界中心场景理解奠定了基础。
AI 推荐理由
论文核心解决多视角空间推理挑战,提出结合思维链与强化学习的框架。
研究机构
上海交通大学
清华大学
北京邮电大学
牛津大学
复旦大学
山东大学
论文信息