VLM Self-Recognition Embodied AI Reasoning Benchmark
摘要

本文借鉴动物界的镜像自我识别测试,探究具身视觉 - 语言模型(VLM)代理是否具备类似的自我认知能力。研究构建了一个受控的 3D 基准测试,要求第一人称视角的 VLM 代理从镜像中推断隐藏的身体属性并选择匹配目标,同时避免自我与他者的错误归因。实验通过移除镜子、引入误导线索及遮挡反射等手段,严格区分基于镜像的自我识别与捷径学习。结果表明,仅较强的 VLM 能利用反射证据指导行动,而较弱模型常无法提取自我相关信息或产生误判。该研究为评估具身自我 grounding 是否根植于感知与行动提供了诊断方法。

AI 推荐理由

论文核心评估 VLM 代理通过镜像进行自我识别的推理能力,涉及逻辑推断与归因。

研究机构
University of Padova Fondazione Bruno Kessler University of Trento
论文信息
作者 Filippo Ziliotto, Ciro Beneduce, Bruno Lepri, Luciano Serafini, Massimiliano Luca et al.
发布日期 2026-05-09
arXiv ID 2605.08816
相关性评分 8/10 (高度相关)