Spatial Reasoning Hierarchical Planning MCTS Embodied AI
摘要

大语言模型在通用理解上表现优异,但在空间推理方面存在显著短板,限制了具身智能应用。受分层强化学习启发,本文提出一种分层任务分解新方法,引导模型识别关键中间状态并生成简化子环境。针对模型因空间先验不足导致分解次优的问题,提出了 MCTS 引导的组相对策略优化(M-GRPO),通过结合预测概率与认知不确定性重构 UCT 公式,并实施细粒度优势函数以学习最优路径规划。实验表明,该方法在导航、规划及策略游戏中显著提升性能,达到最先进水平。

AI 推荐理由

论文提出分层任务分解与 MCTS 引导优化,核心解决空间任务规划问题。

研究机构
The Hong Kong University of Science and Technology (Guangzhou)
论文信息
作者 Yi Wang, Haojie Lu, Zhaofan Zhang, Li Chen, Sihong Xie
发布日期 2026-05-27
arXiv ID 2605.28144
相关性评分 9/10 (高度相关)