摘要
大型语言模型在英语数学推理中表现优异,但在多语言场景下因语言理解缺陷存在显著性能差距。为此,本文提出翻译增强策略优化(TAPO),这是一种基于 GRPO 的新型强化学习框架。TAPO 采用显式对齐策略,以英语为枢纽,遵循“先理解后推理”范式。关键创新在于引入步级相对优势机制,将理解与推理解耦,从而在不引发优化冲突的情况下整合翻译质量奖励。实验表明,TAPO 有效协同了语言理解与推理能力,在多语言数学推理及翻译任务上均优于基线,并具备良好的跨语言和跨领域泛化性。
AI 推荐理由
论文核心解决多语言数学推理问题,提出新框架显著提升推理能力。
研究机构
National Key Laboratory for Novel Software Technology, Nanjing University
论文信息