cognitive alignment benchmark MLLM agents developmental psychology
摘要

尽管代理式 AI 及其核心多模态大语言模型(MLLM)在语言和视觉推理方面展现出巨大潜力,但人工智能与人类智能之间仍存在显著差距。即使集成了强大工具和先进 MLLM,当前最先进的 AI 代理仍常在儿童可轻松解决的基础任务上失败。受韦氏儿童智力量表(WISC)启发,本文提出了 ChildAgentEval,这是首个基于心理测量学的交互式基准,用于评估基于 MLLM 的代理中的认知年龄对齐情况。该基准系统性地比较了各类 MLLM 交互式代理的推理表现与特定年龄的人类发展阶段,揭示了当前代理式 AI 系统在模拟特定年龄认知行为方面的能力与局限。

AI 推荐理由

论文核心在于评估 MLLM Agent 的认知推理能力,通过对比人类儿童发展阶段来衡量其推理水平。

研究机构
PediaMed AI University of Illinois Urbana-Champaign Shenzhen Children's Hospital Hong Kong Polytechnic University
论文信息
作者 Yifan Shen, Jiawen Zhang, Jian Xu, Junho Kim, Ismini Lourentzou et al.
发布日期 2026-05-18
arXiv ID 2605.17894
相关性评分 9/10 (高度相关)