摘要
尽管大语言模型的多语言覆盖范围不断扩大,但其高级推理能力仍主要局限于英语等少数高资源语言。为此,本文提出一种无监督强化学习方法,通过强制跨语言自一致性(即模型对不同语言的等价问题应产生相同答案)来增强多语言推理能力。现有方法受限于多语言推理数据的稀缺且泛化性弱,而本方法无需黄金答案或平行数据。实验显示,该方法在 10 种语言的 MGSM 基准上平均提升达 21.7%,在未见过训练的语言上平均提升 18.2%,并在三个分布外基准上取得显著增益,证明了基于一致性方法在无监督数据下提升多语言能力的潜力。
AI 推荐理由
论文核心提出跨语言自一致性方法,旨在直接提升多语言场景下的逻辑推理能力。
研究机构
HiTZ Center, University of the Basque Country (UPV/EHU)
University of the Basque Country (UPV/EHU)
论文信息