摘要
循环语言模型(LoopLMs)通过迭代潜在计算优化内部表示,为显式思维链推理提供了替代方案。然而,现有强化学习范式主要针对输出令牌,与隐式展开推理的循环架构存在结构错配。本文提出 LoopRPT,一种专为 LoopLMs 设计的强化预训练框架。通过将下一令牌预测重构为推理任务,利用 EMA 教师参考和噪声潜在展开,直接将强化信号赋予潜在步骤。该方法使强化学习能直接塑造中间表示,将有效推理压缩至更少迭代次数。实验表明,LoopRPT 显著提升了每步表示质量,在精度与计算权衡上实现帕累托主导,尤其增强了困难令牌的早期推理能力。
AI 推荐理由
论文核心研究循环架构中的隐式推理机制,通过强化学习优化潜在表示以提升推理效率。
研究机构
清华大学
智谱AI
论文信息