摘要
本文探讨现代 AI 系统是否能像人类一样在陌生环境中快速学习抽象知识并指导行动。研究利用包含复杂人类游戏行为及同步 fMRI 记录的数据集,要求参与者学习需规则发现、假设修正及多步规划的新视频游戏。研究对比了前沿大型推理模型(LRMs)、无模型与基于模型的深度强化学习代理及贝叶斯理论代理。结果显示,LRMs 在游戏探索阶段最接近人类行为模式,且在预测皮层及皮层下脑区活动方面优于其他代理一个数量级。进一步实验表明,这种大脑对齐反映了模型对游戏状态的上下文表征,而非其下游规划或推理过程。
AI 推荐理由
论文评估大型推理模型(LRMs)的规则发现与假设修正能力,核心涉及抽象推理机制。
研究机构
University of Oxford
Columbia University
Massachusetts Institute of Technology
Harvard University
论文信息