摘要
针对部分可观测视觉环境,现有 VLM 智能体虽能通过思维链进行内部模拟,但在稀疏奖励任务中缺乏主动探索“已知未知”的认知动力。本文提出 GLANCE 框架,通过将语言世界模型锚定于演化的目标网络视觉表征,弥合推理与探索的鸿沟。该方法利用语言预测与视觉现实之间的差异作为内在好奇心信号,引导智能体主动探索内部模型不确定的区域。实验表明,对齐智能体的“所思”与“所见”是解决复杂或稀疏任务的关键。
AI 推荐理由
论文核心在于通过好奇心驱动优化 VLM 的内部世界模型与推理一致性,解决稀疏奖励下的探索问题。
研究机构
Department of Computer Science and Engineering, Hong Kong University of Science and Technology (HKUST), Hong Kong, China
Department of Computer Science, University of Southern California, Los Angeles, USA
School of Computing, National University of Singapore, Singapore
论文信息