摘要
强化学习虽能有效提升大模型的多步推理能力,但在多语言场景中应用受限。现有方法面临两难:侧重输入语言一致性会损害推理质量,而侧重推理则导致语言漂移至英语。本文提出 LANG 框架,利用语言条件提示引导非英语推理任务的探索。该方法引入渐进衰减机制逐步撤除辅助,并结合语言自适应开关针对不同语言难度调整学习范围。实验表明,LANG 在显著提升多语言数学推理性能的同时,保持了语言一致性,且具备良好的泛化性。
AI 推荐理由
论文核心在于利用强化学习提升多语言环境下的多步推理能力,直接针对推理质量与语言一致性难题。
研究机构
NLP Lab, School of Computer Science and Engineering, Northeastern University, Shenyang, China
NiuTrans Research, Shenyang, China
论文信息