摘要
在视觉语言导航(VLN)中,仅利用标准动作监督从策略诱导经验中实现自我改进,关键取决于行为多样性与学习稳定性的平衡。过度追求多样性会 destabilize 学习信号,而过分保守则抑制探索。为此,本文提出即插即用的“稳定性 - 多样性平衡”(SDB)机制。该方法通过在指令条件隐藏状态中施加可控偏移,扩展决策步为多个潜在行为假设,并执行可靠性感知的软评估与聚合,以保留多样且一致的替代方案。实验表明,SDB 在多个基准测试中显著提升了导航性能。
AI 推荐理由
论文核心提出自我改进机制,解决多样性与稳定性平衡问题,属 Agent 自我进化范畴。
研究机构
清华大学计算机科学与技术系
论文信息