multimodal dialogue instructional video plan reasoning retrieval
摘要

本文提出 VIGiA,一种新型多模态对话模型,旨在理解并推理复杂的多步教学视频行动计划。不同于以往仅关注文本或孤立处理视听信息的研究,VIGiA 支持基于视觉输入、教学计划及用户交互的接地式对话。该模型具备两大核心能力:多模态计划推理,使查询与当前任务计划对齐;以及基于计划的检索,可获取文本或视觉形式的计划步骤。在烹饪与 DIY 领域的新建数据集上的实验表明,VIGiA 在对话式计划指导任务中超越现有最先进模型,计划感知型视觉问答准确率超 90%。

AI 推荐理由

论文核心聚焦于多步教学视频行动计划的推理与检索,直接解决任务规划问题。

研究机构
NOVA LINCS, NOVA School of Science and Technology, Portugal
论文信息
作者 Diogo Glória-Silva, David Semedo, João Maglhães
发布日期 2026-02-22
arXiv ID 2602.19146
相关性评分 9/10 (高度相关)