摘要
大型语言模型在数学推理方面进展显著,但该能力在不同语言间分布不均,低资源语言表现尤差。为此,本文提出跨语言在线策略自蒸馏(COPSD),将模型在高资源语言中的推理行为迁移至低资源语言。该方法以同一模型充当师生:学生仅见低资源问题,教师则获取包含英文翻译及参考解的跨语言上下文。训练通过最小化学生自身 rollout 的全分布 token 级差异,提供稠密监督,避免了仅基于结果的强化学习的稀疏性与不稳定性。在 17 种非洲低资源语言上的实验表明,COPSD 一致提升了各规模模型的数学推理能力,显著优于 GRPO 基线。
AI 推荐理由
论文核心解决多语言数学推理能力不均问题,提出新蒸馏方法显著提升低资源语言推理性能。
研究机构
慕尼黑大学信息与语言处理中心
论文信息