摘要
针对长程智能体任务中计算效率与泛化能力的矛盾,本文提出 PivotRL 框架。该方法结合监督微调的计算高效性与端到端强化学习的域外泛化优势,通过在现有轨迹上执行局部 rollout 并筛选高方差的关键转折点,同时利用功能等价动作的奖励机制而非严格字符串匹配。理论证明该机制能激发强学习信号。实验显示,相比标准 SFT,PivotRL 在域内准确率平均提升 4.17%,域外任务提升 10.04%,且在智能体编码任务中以四分之一的 rollout 次数达到同等精度,已应用于 NVIDIA 大规模生产模型。
AI 推荐理由
论文提出 PivotRL 框架,通过强化学习优化 Agent 策略,实现自我改进与泛化能力提升,属核心进化研究。
研究机构
NVIDIA
UC Berkeley
论文信息