Long-horizon Reasoning Embodied AI Multimodal LLM Benchmark
摘要

多模态大语言模型(MLLMs)被视为具身智能体的基础,但其在自我中心视角下对动作长期物理后果的推理能力尚不明确。本文提出“基于长视野推理的自我中心场景预测”新任务,要求模型根据初始场景图像和原子动作序列预测最终场景。为此,我们构建了 EXPLORE-Bench 基准,源自真实第一人称视频,包含多样化的场景及结构化标注。实验表明,现有 MLLM 与人类表现存在显著差距,长视野推理仍是重大挑战。进一步分析显示,逐步推理分解动作序列可提升性能,但伴随计算开销。该基准为评估和提升具身感知中的长视野推理提供了原则性测试平台。

AI 推荐理由

论文核心研究长视野推理能力,提出新任务与基准评估 MLLM 在自我中心视角下的物理后果推理。

研究机构
中国科学技术大学信息科学与技术学院 Foundation Model Team, Li Auto Inc.
论文信息
作者 Chengjun Yu, Xuhan Zhu, Chaoqun Du, Pengfei Yu, Wei Zhai et al.
发布日期 2026-03-10
arXiv ID 2603.09731
相关性评分 9/10 (高度相关)