摘要
针对现有第一人称视频基准缺乏对细粒度操作推理及时空证据 grounding 评估的问题,本文提出 EgoCoT-Bench。该基准包含 351 个视频中的 3172 个可验证问答对,涵盖感知、回溯、预测及高层推理任务。通过时空场景图引导生成并经人工 refinement,确保推理步骤的细粒度与可验证性。实验表明,当前多模态模型虽能给出正确答案,但其解释往往缺乏一致的时空证据支持,揭示了细粒度推理的挑战。
AI 推荐理由
论文核心聚焦于评估多模态大模型在第一人称视角下的细粒度操作链式推理能力,提出可验证的推理基准。
研究机构
Zhejiang University, Hangzhou, Zhejiang, China
论文信息