摘要
大语言模型在通用理解上表现优异,但在空间推理方面存在显著短板,限制了具身智能应用。受分层强化学习启发,本文提出一种分层任务分解新方法,引导模型识别关键中间状态并生成简化子环境。针对模型因空间先验不足导致分解次优的问题,提出了 MCTS 引导的组相对策略优化(M-GRPO),通过结合预测概率与认知不确定性重构 UCT 公式,并实施细粒度优势函数以学习最优路径规划。实验表明,该方法在导航、规划及策略游戏中显著提升性能,达到最先进水平。
AI 推荐理由
论文提出分层任务分解与 MCTS 引导优化,核心解决空间任务规划问题。
研究机构
The Hong Kong University of Science and Technology (Guangzhou)
论文信息