Multimodal Reasoning Egocentric Vision Benchmark Referential Grounding
摘要

第一人称 AI 代理依赖指点手势消除自然语言指令中的指代歧义,但现有多模态大语言模型常因依赖虚假相关性而产生“指代幻觉”。为此,本文提出 EgoPoint-Bench,一个包含超 1.1 万样本的综合问答基准,涵盖五个评估维度及三种指代复杂度。实验表明,虽现有模型表现不佳,但在合成数据上微调的模型显著提升了性能并实现了鲁棒的仿真到现实迁移。本研究强调了空间感知监督的重要性,为精准的第一人称 AI 助手提供了可扩展路径。

AI 推荐理由

论文核心解决多模态指代推理中的幻觉问题,构建基准并提升空间语义理解能力。

研究机构
清华大学自动化系
论文信息
作者 Chentao Li, Zirui Gao, Mingze Gao, Yinglian Ren, Jianjiang Feng et al.
发布日期 2026-04-23
arXiv ID 2604.21461
相关性评分 9/10 (高度相关)