摘要
现有研究多将大语言模型的文化智能简化为知识问题,忽视了其在现实场景中有效利用知识的能力。为此,本文提出 CultureForest,一个用于评估“基于文化规范的推理”的基准。该基准将问题锚定于原子规范,支持可验证评估,涵盖 8 个领域、53 个国家/地区的 5378 个样本。实验表明,顶尖模型在开放生成设置下性能显著下降且存在区域差异。研究发现测试时推理增益有限,模型反应保守,且主要瓶颈在于文化知识的有效运用而非获取本身。
AI 推荐理由
论文核心研究基于文化规范的推理能力,提出新基准并深入分析推理瓶颈。
研究机构
Harbin Institute of Technology
The University of Hong Kong
论文信息