摘要
随着通用智能体系统追求更宏大目标,基础大语言模型亟需更强的智能体能力。智能体强化学习(Agentic RL)成为关键的后训练范式,旨在多轮交互中优化决策与工具使用等核心技能,并解决奖励稀疏延迟及长上下文挑战。本文提出 StepPO,主张将传统的令牌级马尔可夫决策过程升级为步级 formulation,视“步”为智能体的基本动作单元。通过引入步级信用分配,使策略优化与奖励传播粒度与智能体决策对齐。初步实验验证了该范式的有效性,为提升大模型通用智能体能力提供了新视角。
AI 推荐理由
论文核心提出步级强化学习范式,旨在优化智能体的决策与工具使用等核心技能。
研究机构
State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China
论文信息