摘要
针对大语言模型在长上下文任务中需保持准确性与连贯性的挑战,现有离线策略方法存在暴露偏差,而在线策略强化学习则面临奖励稀疏导致的不稳定问题。本文提出蒸馏群组相对策略优化(dGRPO),通过引入教师模型的密集令牌级指导来增强 GRPO,有效结合了结果导向的策略优化与知识蒸馏。此外,构建了涵盖多跳推理等任务的 LongBlocks 数据集。实验表明,该方法在提升长上下文推理能力的同时,保持了短上下文性能,为长上下文对齐提供了更稳定高效的路径。
AI 推荐理由
论文核心提出 dGRPO 方法,旨在解决长上下文下的多跳推理与逻辑连贯性问题。
研究机构
Instituto Superior Técnico, Universidade de Lisboa
Instituto de Telecomunicações
ELLS Unit Lisbon
论文信息