摘要
针对现实场景中目标物体常被遮挡的问题,本文提出 SceneFunRI 基准,旨在评估视觉语言模型(VLM)基于上下文和常识推理不可见物体位置的能力。该基准包含 855 个实例,要求模型根据任务指令推断隐藏的功能性物体位置。实验显示当前最强模型表现不佳,证明了不可见区域推理仍是 VLM 的薄弱环节。研究进一步分析了多种提示策略,指出未来需深度融合任务意图、常识先验与空间定位能力。
AI 推荐理由
论文核心聚焦于利用常识推理推断不可见物体位置,属于典型的推理能力研究。
研究机构
National Taiwan University
Delta Robotics Innovation Center
论文信息