Social Reasoning Evaluation Framework Critical Thinking
摘要

现有大语言模型推理研究多关注数学或技术任务,鲜少涉及塑造社会规范的文化与制度等抽象社会概念。本文提出 SCRuB 框架,旨在通过基于量表的评估方法,衡量模型在社会概念推理上是否具备人类专家的深度与严谨性。该框架包含提示构建、响应生成及基于五维批判性思维量表的对比评估三个阶段,并引入学科视角专家组以确保泛化性。实验结果显示,前沿模型在所有维度上均超越人类专家,表明当前单次考试式评估格式已达饱和。

AI 推荐理由

论文核心聚焦于评估 LLM 在社会概念领域的推理深度与批判性思维,属于推理能力研究。

研究机构
Meta McGill University Handshake AI Scale AI
论文信息
作者 Jamelle Watson-Daniels, Himaghna Bhattacharjee, Skyler Wang, Brandon Handoko, Antonio Li et al.
发布日期 2026-05-07
arXiv ID 2605.06444
相关性评分 9/10 (高度相关)