Implicit Rules Reinforcement Learning Deep Reasoning Agent Framework
摘要

针对智能体在受隐式规则支配环境中易陷入重复试错循环的问题,本文提出测试时探索(TTExplore)框架。该框架包含一个“思考者”组件,通过分析交互历史推断隐式规则并指导“执行者”。为克服深度推理轨迹评估不稳定的难题,作者引入一种新颖的强化学习流程,利用任务级分数作为间接奖励,并保留每条轨迹的单一思考节点以缓解奖励稀疏性。基于此训练的 Exp-Thinker 模型在五个文本具身任务中显著提升了基线性能。

AI 推荐理由

论文核心在于通过深度推理推断隐式规则,解决 Agent 试错失败问题。

研究机构
北京邮电大学, 中国 青岛大学, 中国 UESTC, 中国 清华大学, 中国 天津大学, 中国 约翰霍普金斯大学, 美国 上海交通大学, 中国 中国人民大学, 中国
论文信息
作者 Wentong Chen, Xin Cong, Zhong Zhang, Yaxi Lu, Siyuan Zhao et al.
发布日期 2026-05-24
arXiv ID 2605.24828
相关性评分 9/10 (高度相关)