摘要
前沿模型在整合基于任务奖励的强化学习(RL)后展现出卓越能力,实现了从纯推理模型向复杂智能体的进化。然而,关于 RL 是赋予新技能还是仅锐化现有分布以激发潜在能力仍存在争议。本文利用 RL 作为工具,明确对比了分布锐化与基于任务奖励的学习范式。分析揭示了分布锐化的固有局限性,证明其最优解可能不利且方法根本不稳定。实验证实,锐化增益有限,而引入任务奖励信号能显著提升性能并实现稳定学习。
AI 推荐理由
论文核心探讨基于任务奖励的 RL 如何驱动模型从推理者进化为智能体,涉及自我改进机制。
研究机构
Université de Montréal
论文信息