Agentic RL Step-level MDP Policy Optimization Tool Use Decision Making
摘要

随着通用智能体系统追求更宏大目标,基础大语言模型亟需更强的智能体能力。智能体强化学习(Agentic RL)成为关键的后训练范式,旨在多轮交互中优化决策与工具使用等核心技能,并解决奖励稀疏延迟及长上下文挑战。本文提出 StepPO,主张将传统的令牌级马尔可夫决策过程升级为步级 formulation,视“步”为智能体的基本动作单元。通过引入步级信用分配,使策略优化与奖励传播粒度与智能体决策对齐。初步实验验证了该范式的有效性,为提升大模型通用智能体能力提供了新视角。

AI 推荐理由

论文核心提出步级强化学习范式,旨在优化智能体的决策与工具使用等核心技能。

研究机构
State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China
论文信息
作者 Daoyu Wang, Qingchuan Li, Mingyue Cheng, Jie Ouyang, Shuo Yu et al.
发布日期 2026-04-20
arXiv ID 2604.18401
相关性评分 9/10 (高度相关)