multilingual benchmark reasoning evaluation
摘要

本文介绍了 mmPISA-bench,这是一个源自 OECD PISA 测试的高质量紧凑型多语言推理基准。该基准包含 25 道需推理才能解答的多选题,提供 43 种语言的官方人工翻译及机器翻译版本。研究评估了主流专有 LLM 在不同语言、推理难度及翻译类型下的表现。结果显示,现代 LLM 在所有评估语言中均能有效推理,准确率媲美人类,且机器翻译未降低准确性。此外,分析发现部分语言的推理成本更高且准确率较低。

AI 推荐理由

论文核心是构建多语言推理基准并评估 LLM 的推理能力,直接聚焦推理主题。

研究机构
Independent Scholar School of Computer Science, Carnegie Mellon University
论文信息
作者 Yerzhan Sapenov, Jaromir Savelka
发布日期 2026-06-05
arXiv ID 2606.07069
相关性评分 9/10 (高度相关)