摘要
针对智能体在受隐式规则支配环境中易陷入重复试错循环的问题,本文提出测试时探索(TTExplore)框架。该框架包含一个“思考者”组件,通过分析交互历史推断隐式规则并指导“执行者”。为克服深度推理轨迹评估不稳定的难题,作者引入一种新颖的强化学习流程,利用任务级分数作为间接奖励,并保留每条轨迹的单一思考节点以缓解奖励稀疏性。基于此训练的 Exp-Thinker 模型在五个文本具身任务中显著提升了基线性能。
AI 推荐理由
论文核心在于通过深度推理推断隐式规则,解决 Agent 试错失败问题。
研究机构
北京邮电大学, 中国
青岛大学, 中国
UESTC, 中国
清华大学, 中国
天津大学, 中国
约翰霍普金斯大学, 美国
上海交通大学, 中国
中国人民大学, 中国
论文信息