Visual-Language Models Commonsense Reasoning Occluded Object Localization Benchmark
摘要

针对现实场景中目标物体常被遮挡的问题,本文提出 SceneFunRI 基准,旨在评估视觉语言模型(VLM)基于上下文和常识推理不可见物体位置的能力。该基准包含 855 个实例,要求模型根据任务指令推断隐藏的功能性物体位置。实验显示当前最强模型表现不佳,证明了不可见区域推理仍是 VLM 的薄弱环节。研究进一步分析了多种提示策略,指出未来需深度融合任务意图、常识先验与空间定位能力。

AI 推荐理由

论文核心聚焦于利用常识推理推断不可见物体位置,属于典型的推理能力研究。

研究机构
National Taiwan University Delta Robotics Innovation Center
论文信息
作者 Posheng Chen, Powen Cheng, Gueter Josmy Faure, Hung-Ting Su, Winston H. Hsu
发布日期 2026-05-14
arXiv ID 2605.14704
相关性评分 9/10 (高度相关)