Long-Context Reasoning Reinforcement Learning Knowledge Distillation dGRPO
摘要

针对大语言模型在长上下文任务中需保持准确性与连贯性的挑战,现有离线策略方法存在暴露偏差,而在线策略强化学习则面临奖励稀疏导致的不稳定问题。本文提出蒸馏群组相对策略优化(dGRPO),通过引入教师模型的密集令牌级指导来增强 GRPO,有效结合了结果导向的策略优化与知识蒸馏。此外,构建了涵盖多跳推理等任务的 LongBlocks 数据集。实验表明,该方法在提升长上下文推理能力的同时,保持了短上下文性能,为长上下文对齐提供了更稳定高效的路径。

AI 推荐理由

论文核心提出 dGRPO 方法,旨在解决长上下文下的多跳推理与逻辑连贯性问题。

研究机构
Instituto Superior Técnico, Universidade de Lisboa Instituto de Telecomunicações ELLS Unit Lisbon
论文信息
作者 Miguel Moura Ramos, Duarte M. Alves, André F. T. Martins
发布日期 2026-05-12
arXiv ID 2605.12227
相关性评分 9/10 (高度相关)