multilingual reasoning self-consistency unsupervised RL cross-lingual
摘要

尽管大语言模型的多语言覆盖范围不断扩大,但其高级推理能力仍主要局限于英语等少数高资源语言。为此,本文提出一种无监督强化学习方法,通过强制跨语言自一致性(即模型对不同语言的等价问题应产生相同答案)来增强多语言推理能力。现有方法受限于多语言推理数据的稀缺且泛化性弱,而本方法无需黄金答案或平行数据。实验显示,该方法在 10 种语言的 MGSM 基准上平均提升达 21.7%,在未见过训练的语言上平均提升 18.2%,并在三个分布外基准上取得显著增益,证明了基于一致性方法在无监督数据下提升多语言能力的潜力。

AI 推荐理由

论文核心提出跨语言自一致性方法,旨在直接提升多语言场景下的逻辑推理能力。

研究机构
HiTZ Center, University of the Basque Country (UPV/EHU) University of the Basque Country (UPV/EHU)
论文信息
作者 Ahmed Elhady, Eneko Agirre, Mikel Artetxe
发布日期 2026-05-31
arXiv ID 2606.01464
相关性评分 9/10 (高度相关)