Causal Reasoning Transfer Learning LLM Evaluation Human-AI Comparison
摘要

提取抽象因果结构并应用于新情境是人类智能的标志。尽管大语言模型(LLM)和视觉语言模型(VLM)在多种推理任务中表现优异,但其通过序列探索诱导潜在结构并进行跨语境迁移的交互式因果学习能力尚不明确。本研究利用 OpenLock 范式发现,现有模型表现出根本性的迁移延迟或缺失:成功模型需先进行特定环境的“落地”映射才能提升效率,而人类则能直接利用先验结构知识。此外,视觉信息反而降低了模型性能,且模型表现出人类没有的因果不对称性。这表明大规模统计学习尚未产生支撑人类类比推理的去上下文因果图式。

AI 推荐理由

论文核心评估 LLM/VLM 的因果推理与结构迁移能力,揭示其缺乏人类式的抽象因果图式。

研究机构
清华大学自动化系 中国科学院自动化研究所 北京大学心理与认知科学学院 北京大学行为与脑科学国家重点实验室
论文信息
作者 Liangru Xiang, Yuxi Ma, Zhihao Cao, Yixin Zhu, Song-Chun Zhu
发布日期 2026-04-27
arXiv ID 2604.24062
相关性评分 9/10 (高度相关)