摘要
多视图视觉推理对智能系统理解复杂环境至关重要,但现有研究多集中于单图或密集视频场景。本文利用物理仿真构建高保真 3D 场景,推出 VIEW2SPACE 基准,支持大规模稀疏多视图推理评估。实验表明现有模型表现不佳,而提出的“带视觉证据的接地思维链”方法显著提升了中等难度下的性能,并泛化至真实数据。研究还揭示了跨稀疏视图的深度组合推理仍是根本性挑战。
AI 推荐理由
论文核心研究多视图视觉推理,提出新基准与推理方法,直接针对推理能力。
研究机构
澳大利亚莫纳什大学
新加坡国立大学
论文信息