cognitive evaluation neuropsychology LLM benchmarks abstract reasoning
摘要

大型语言模型在多项基准测试中表现出统一的“通用因子”能力,但在人类看来简单的任务上仍表现不佳。这是因为现有基准侧重于任务完成,未能探测揭示这些行为的基础认知能力。本文提出 NeuroCognition 基准,基于三项改编的神经心理学测试:瑞文渐进矩阵(抽象关系推理)、空间工作记忆(维持与系统搜索)和威斯康星卡片分类测试(认知灵活性)。评估显示,模型在文本上表现强劲,但在图像及复杂度增加时性能下降。研究发现复杂推理并非普遍有益,而简单类人策略可带来部分增益。该基准与通用能力基准正相关,同时测量了独特的认知能力,揭示了 LLM 与类人智能的异同。

AI 推荐理由

论文核心在于评估 LLM 的抽象推理、认知灵活性等基础认知能力,直接对应推理主题。

研究机构
KAIST, Daejeon, South Korea
论文信息
作者 Faiz Ghifari Haznitrama, Faeyza Rishad Ardi, Alice Oh
发布日期 2026-03-03
arXiv ID 2603.02540
相关性评分 9/10 (高度相关)