Reinforcement Learning Multilingual Reasoning Language Consistency LLM
摘要

强化学习虽能有效提升大模型的多步推理能力,但在多语言场景中应用受限。现有方法面临两难:侧重输入语言一致性会损害推理质量,而侧重推理则导致语言漂移至英语。本文提出 LANG 框架,利用语言条件提示引导非英语推理任务的探索。该方法引入渐进衰减机制逐步撤除辅助,并结合语言自适应开关针对不同语言难度调整学习范围。实验表明,LANG 在显著提升多语言数学推理性能的同时,保持了语言一致性,且具备良好的泛化性。

AI 推荐理由

论文核心在于利用强化学习提升多语言环境下的多步推理能力,直接针对推理质量与语言一致性难题。

研究机构
NLP Lab, School of Computer Science and Engineering, Northeastern University, Shenyang, China NiuTrans Research, Shenyang, China
论文信息
作者 Yuchun Fan, Bei Li, Peiguang Li, Yilin Wang, Yongyu Mu et al.
发布日期 2026-05-21
arXiv ID 2605.22567
相关性评分 9/10 (高度相关)