Self-Improvement Vision-and-Language Navigation Policy Learning Exploration-Exploitation
摘要

在视觉语言导航(VLN)中,仅利用标准动作监督从策略诱导经验中实现自我改进,关键取决于行为多样性与学习稳定性的平衡。过度追求多样性会 destabilize 学习信号,而过分保守则抑制探索。为此,本文提出即插即用的“稳定性 - 多样性平衡”(SDB)机制。该方法通过在指令条件隐藏状态中施加可控偏移,扩展决策步为多个潜在行为假设,并执行可靠性感知的软评估与聚合,以保留多样且一致的替代方案。实验表明,SDB 在多个基准测试中显著提升了导航性能。

AI 推荐理由

论文核心提出自我改进机制,解决多样性与稳定性平衡问题,属 Agent 自我进化范畴。

研究机构
清华大学计算机科学与技术系
论文信息
作者 Zhen Liu, Yuhan Liu, Jinjun Wang, Jianyi Liu, Wei Song et al.
发布日期 2026-04-21
arXiv ID 2604.19064
相关性评分 9/10 (高度相关)