摘要
近期多轮强化学习的进展显著提升了推理大模型在复杂交互任务中的表现。尽管已有细粒度信用分配和轨迹过滤等稳定技术,训练不稳定及崩溃仍普遍存在。本文认为该问题源于多轮设置下的低效探索,即策略持续生成既未减少不确定性也未推动任务进展的低信息动作。为此,我们提出令牌与回合级策略优化(T$^2$PO),这是一种感知不确定性的框架,能在细粒度上显式控制探索。在令牌级,T$^2$PO监控不确定性动态,当边际变化低于阈值时触发思考干预;在回合级,识别探索进展微不足道的交互并动态重采样以避免浪费。实验表明该方法显著提升了训练稳定性与性能。
AI 推荐理由
论文核心解决多轮交互中推理模型的训练不稳定问题,通过不确定性引导探索优化推理过程。
研究机构
University of California, Los Angeles
Amazon.com Inc.
论文信息