摘要
推理语言模型(RLMs)在复杂任务中表现优异,但在非英语输入上存在显著的多语言推理差距。虽然翻译可缓解理解失败,但全量翻译并非必要。为此,本文提出 Luar,一种感知语言理解边界的强化学习框架,训练 RLMs 仅在直接理解不可靠时选择性调用翻译。实验表明,Luar 在多语言基准测试中优于现有基线,尤其在低资源语言上增益显著,且能避免不必要的翻译操作。
AI 推荐理由
论文核心解决多语言推理差距,提出选择性翻译机制以增强推理可靠性。
研究机构
Graduate School of Artificial Intelligence
Department of Computer Science & Engineering
POSTECH, South Korea
论文信息