摘要
针对具身视觉 - 语言决策任务中的感知瓶颈(即模型难以区分任务相关物体与干扰物导致视觉幻觉),本文提出 SceneDiver 方法。该方法利用 VLM 的长期规划能力,采用由粗到细的焦点规划生成策略:首先构建整体场景图以建立初步理解,随后通过识别、理解和分析的迭代循环,将任务逐步分解为更简单的子问题。此外,设计了轻量级适配器,将此深思熟虑的聚焦能力蒸馏至擅长反应控制的 VLA 模型中。实验表明,该方法显著减少了视觉幻觉,同时保持了快速执行任务的计算效率。
AI 推荐理由
论文提出“焦点规划生成”方法,核心在于利用长期规划能力分解任务,解决感知瓶颈。
研究机构
State Key Lab of CAD&CG, Zhejiang University, China
论文信息