摘要
尽管代理式 AI 及其核心多模态大语言模型(MLLM)在语言和视觉推理方面展现出巨大潜力,但人工智能与人类智能之间仍存在显著差距。即使集成了强大工具和先进 MLLM,当前最先进的 AI 代理仍常在儿童可轻松解决的基础任务上失败。受韦氏儿童智力量表(WISC)启发,本文提出了 ChildAgentEval,这是首个基于心理测量学的交互式基准,用于评估基于 MLLM 的代理中的认知年龄对齐情况。该基准系统性地比较了各类 MLLM 交互式代理的推理表现与特定年龄的人类发展阶段,揭示了当前代理式 AI 系统在模拟特定年龄认知行为方面的能力与局限。
AI 推荐理由
论文核心在于评估 MLLM Agent 的认知推理能力,通过对比人类儿童发展阶段来衡量其推理水平。
研究机构
PediaMed AI
University of Illinois Urbana-Champaign
Shenzhen Children's Hospital
Hong Kong Polytechnic University
论文信息