multilingual reasoning reinforcement learning selective translation
摘要

推理语言模型(RLMs)在复杂任务中表现优异,但在非英语输入上存在显著的多语言推理差距。虽然翻译可缓解理解失败,但全量翻译并非必要。为此,本文提出 Luar,一种感知语言理解边界的强化学习框架,训练 RLMs 仅在直接理解不可靠时选择性调用翻译。实验表明,Luar 在多语言基准测试中优于现有基线,尤其在低资源语言上增益显著,且能避免不必要的翻译操作。

AI 推荐理由

论文核心解决多语言推理差距,提出选择性翻译机制以增强推理可靠性。

研究机构
Graduate School of Artificial Intelligence Department of Computer Science & Engineering POSTECH, South Korea
论文信息
作者 Deokhyung Kang, Hyounghun Kim, Gary Geunbae Lee
发布日期 2026-06-01
arXiv ID 2606.02465
相关性评分 9/10 (高度相关)