摘要
在动态开放世界环境中,自主智能体常因遇到新奇物体而无法生成有效计划。传统符号规划器因缺乏相应操作算子而失效。本文提出一种融合符号规划、强化学习与大型语言模型(LLM)的神经符号架构。该方法利用 LLM 的常识推理能力识别缺失算子,协同符号 AI 规划器生成计划,并编写奖励函数引导强化学习智能体学习新算子的控制策略。实验表明,该方法在连续机器人领域的算子发现与学习任务上优于现有技术。
AI 推荐理由
论文核心提出混合神经符号架构,利用 LLM 辅助符号规划器发现缺失算子并生成计划,解决动态环境下的规划难题。
研究机构
Department of Computer Science, Tufts University, Medford, MA, USA
Austrian Institute of Technology, Vienna, Austria
论文信息