摘要
本文借鉴动物界的镜像自我识别测试,探究具身视觉 - 语言模型(VLM)代理是否具备类似的自我认知能力。研究构建了一个受控的 3D 基准测试,要求第一人称视角的 VLM 代理从镜像中推断隐藏的身体属性并选择匹配目标,同时避免自我与他者的错误归因。实验通过移除镜子、引入误导线索及遮挡反射等手段,严格区分基于镜像的自我识别与捷径学习。结果表明,仅较强的 VLM 能利用反射证据指导行动,而较弱模型常无法提取自我相关信息或产生误判。该研究为评估具身自我 grounding 是否根植于感知与行动提供了诊断方法。
AI 推荐理由
论文核心评估 VLM 代理通过镜像进行自我识别的推理能力,涉及逻辑推断与归因。
研究机构
University of Padova
Fondazione Bruno Kessler
University of Trento
论文信息