摘要
现有大语言模型推理研究多关注数学或技术任务,鲜少涉及塑造社会规范的文化与制度等抽象社会概念。本文提出 SCRuB 框架,旨在通过基于量表的评估方法,衡量模型在社会概念推理上是否具备人类专家的深度与严谨性。该框架包含提示构建、响应生成及基于五维批判性思维量表的对比评估三个阶段,并引入学科视角专家组以确保泛化性。实验结果显示,前沿模型在所有维度上均超越人类专家,表明当前单次考试式评估格式已达饱和。
AI 推荐理由
论文核心聚焦于评估 LLM 在社会概念领域的推理深度与批判性思维,属于推理能力研究。
研究机构
Meta
McGill University
Handshake AI
Scale AI
论文信息