LLM Reasoning Reinforcement Learning Multilingual Exploration and Exploitation
摘要

当前大型推理模型(LRMs)经强化学习后训练在挑战性任务上表现优异,但现有工作多局限于英语推理。本文提出 ExpLang,一种新颖的 LLM 后训练流程,通过在强化学习中引入策略内的思维语言选择动作,利用多语言优势改善探索与利用效率。结果表明,该方法在同等训练预算下稳定优于纯英语训练,并对可见及不可见语言展现出高度的思维语言依从性。分析表明,该机制有效扩展了强化学习的探索空间,并利用非语言优势提升了利用效果,为多语言增强推理模型开辟了新视角。

AI 推荐理由

论文核心研究通过多语言思维选择优化 LLM 推理过程中的探索与利用,直接提升推理模型性能。

研究机构
清华大学
论文信息
作者 Changjiang Gao, Zixian Huang, Kaichen Yang, Jiajun Chen, Jixing Li et al.
发布日期 2026-02-25
arXiv ID 2602.21887
相关性评分 9/10 (高度相关)