摘要
针对现有多模态大模型在第一人称视觉中难以准确进行交互推理和细粒度像素定位的问题,本文提出 EARL 框架。该框架采用两阶段解析机制:首先 holistic 解释交互并生成结构化描述,随后基于查询生成文本答案与像素掩码。通过提取全局交互描述符作为语义先验,并利用分析引导特征合成器(AFS)桥接两阶段以支持面向查询的推理。此外,设计了多面奖励函数并结合 GRPO 算法优化异构输出。实验表明,EARL 在像素定位任务上显著优于现有方法,且具备强大的泛化能力。
AI 推荐理由
论文核心在于通过强化学习提升第一人称视角下的交互推理与像素定位能力。
研究机构
香港理工大学
论文信息