Autonomous Exploration Agent Planning Reinforcement Learning Explore-then-Act
摘要

基于大语言模型的智能体常因过早利用先验知识而在陌生环境中失败。本文指出自主探索是构建自适应智能体的关键能力,并提出“探索检查点覆盖率”指标以量化该能力。针对标准强化学习导致的狭隘行为,作者开发了一种交替执行任务与探索的训练策略,并提出“先探索后行动”范式,将信息收集与任务执行解耦:智能体先利用交互预算获取环境知识,再用于任务解决。结果表明,系统性探索对构建通用智能体至关重要。

AI 推荐理由

论文提出“先探索后行动”范式,核心在于重构智能体的任务规划与信息获取策略。

研究机构
University of Science and Technology of China Meituan
论文信息
作者 Ziang Ye, Wentao Shi, Yuxin Liu, Yu Wang, Zhengzhou Cai et al.
发布日期 2026-05-15
arXiv ID 2605.16143
相关性评分 9/10 (高度相关)