Vision-Language Models Embodied AI Task Planning Visual Hallucination
摘要

针对具身视觉 - 语言决策任务中的感知瓶颈(即模型难以区分任务相关物体与干扰物导致视觉幻觉),本文提出 SceneDiver 方法。该方法利用 VLM 的长期规划能力,采用由粗到细的焦点规划生成策略:首先构建整体场景图以建立初步理解,随后通过识别、理解和分析的迭代循环,将任务逐步分解为更简单的子问题。此外,设计了轻量级适配器,将此深思熟虑的聚焦能力蒸馏至擅长反应控制的 VLA 模型中。实验表明,该方法显著减少了视觉幻觉,同时保持了快速执行任务的计算效率。

AI 推荐理由

论文提出“焦点规划生成”方法,核心在于利用长期规划能力分解任务,解决感知瓶颈。

研究机构
State Key Lab of CAD&CG, Zhejiang University, China
论文信息
作者 Boyuan Xiao, Bohong Chen, Yumeng Li, Ji Feng, Yao-Xiang Ding et al.
发布日期 2026-06-02
arXiv ID 2606.04046
相关性评分 9/10 (高度相关)