摘要
本文指出当前智能体强化学习(如 PPO、GRPO)对轨迹中所有令牌均匀分配信用,导致训练信号错配。研究发现,尽管动作令牌占比小,但与奖励方差相关的训练信号高度集中于动作令牌,形成“动作瓶颈”。为此,作者提出 ActFocus 方法,通过降低推理令牌梯度权重并引入基于能量的重分布机制,显著提升高不确定性动作的权重。实验表明,该方法在多种环境下均优于基准模型,且无额外计算开销。
AI 推荐理由
论文核心解决智能体在长推理轨迹中的训练信号分配问题,直接优化推理过程。
研究机构
University of Illinois Chicago
Potsdam Institute for Climate Impact Research
Technical University of Berlin
University of Southern California
University of Hong Kong
Broad Institute of MIT and Harvard
论文信息