摘要
近期代理测试时扩展技术允许模型在执行最终动作前收集环境反馈,但现有方法常采用无差别的探索策略,缺乏自适应区分何时需要真正探索的能力。本文提出一种探索感知的强化学习框架,使 LLM 代理仅在高不确定性时进行自适应探索。该方法引入基于变分推断的细粒度奖励函数,显式评估探索动作对未来决策的改进潜力,并结合探索感知分组机制,在优化过程中分离探索动作与任务完成动作。实验表明,该方法在多种文本及 GUI 基准测试中均取得一致提升。
AI 推荐理由
论文核心提出探索感知框架,通过自适应探索优化 Agent 在测试时的推理决策过程。
研究机构
Department of Computer Science and Technology, Tsinghua University, Beijing, China
论文信息