Cultural Intelligence Reasoning Benchmark LLM Evaluation
摘要

现有研究多将大语言模型的文化智能简化为知识问题,忽视了其在现实场景中有效利用知识的能力。为此,本文提出 CultureForest,一个用于评估“基于文化规范的推理”的基准。该基准将问题锚定于原子规范,支持可验证评估,涵盖 8 个领域、53 个国家/地区的 5378 个样本。实验表明,顶尖模型在开放生成设置下性能显著下降且存在区域差异。研究发现测试时推理增益有限,模型反应保守,且主要瓶颈在于文化知识的有效运用而非获取本身。

AI 推荐理由

论文核心研究基于文化规范的推理能力,提出新基准并深入分析推理瓶颈。

研究机构
Harbin Institute of Technology The University of Hong Kong
论文信息
作者 Yangfan Ye, Xiaocheng Feng, Jialong Tang, Xiayu Cao, Zihan Zhang et al.
发布日期 2026-06-01
arXiv ID 2606.01879
相关性评分 9/10 (高度相关)