摘要
当前大型推理模型(LRMs)经强化学习后训练在挑战性任务上表现优异,但现有工作多局限于英语推理。本文提出 ExpLang,一种新颖的 LLM 后训练流程,通过在强化学习中引入策略内的思维语言选择动作,利用多语言优势改善探索与利用效率。结果表明,该方法在同等训练预算下稳定优于纯英语训练,并对可见及不可见语言展现出高度的思维语言依从性。分析表明,该机制有效扩展了强化学习的探索空间,并利用非语言优势提升了利用效果,为多语言增强推理模型开辟了新视角。
AI 推荐理由
论文核心研究通过多语言思维选择优化 LLM 推理过程中的探索与利用,直接提升推理模型性能。
研究机构
清华大学
论文信息