Spatial Reasoning Prompt Routing Vision-Language Models Zero-Shot Learning
摘要

针对第一人称视频的空间问答任务,本文提出 SpatioRoute,一种无需额外训练或 3D 传感器输入的动态提示生成方法。该方法通过规则或 LLM 驱动的路由机制,将问题映射至语义定制的提示模板。在 SQA3D 基准测试中,相比固定提示基线,该方法显著提升了准确率,确立了零样本视频空间问答的新状态。此外,研究发现思维链提示在此场景下反而降低性能,证实了感知问题的路由优于统一推理指令。

AI 推荐理由

论文核心研究零样本空间推理,通过动态提示路由提升 VLM 推理能力。

研究机构
National Taiwan University
论文信息
作者 Pawat Chunhachatrachai, Gueter Josmy Faure, Hung-Ting Su, Winston H. Hsu
发布日期 2026-05-18
arXiv ID 2605.18209
相关性评分 9/10 (高度相关)