摘要
长程推理不仅需决定采取何种行动,还需确定在下次观察前应承诺多深的执行粒度。本文将此形式化为“承诺深度”,即重规划间开环执行的原语动作数量。现有系统多将其固定为手工设计的标量,而本文将其视为策略本身可学习的状态条件变量。通过在视觉 - 语言模型中联合预测执行内容与时长的自适应策略,在滑动拼图和推箱子任务上显著优于固定深度基线及主流大模型,实现了更高的求解率与更少的动作消耗。
AI 推荐理由
论文核心研究长程任务中的重规划频率与承诺深度,属于任务规划的关键机制。
研究机构
Carnegie Mellon University
论文信息