多模态学习 常识推理 知识图谱 视觉故事讲述
摘要

本文提出了 MMCOMET,这是首个整合物理、社会和事件知识的多模态常识知识图谱(MMKG)。通过高效的图像检索过程,MMCOMET 扩展了 ATOMIC2020 知识图谱以包含视觉维度,生成了超过 90 万条多模态三元组。该资源解决了现有 MMKG 在支持图像描述和故事讲述等复杂推理任务方面的主要局限。标准的视觉故事讲述实验表明,这种整体方法能够生成比仅使用文本知识更丰富、连贯且基于上下文的故事,为多模态常识推理和叙事生成奠定了新基础。

AI 推荐理由

论文构建多模态常识图谱以支持复杂推理任务,核心聚焦于提升上下文推理能力。

研究机构
悉尼大学 达姆施塔特工业大学 墨尔本大学 爱丁堡大学
论文信息
作者 Eileen Wang, Hiba Arnaout, Dhita Pratama, Shuo Yang, Dangyang Liu et al.
发布日期 2026-03-01
arXiv ID 2603.01055
相关性评分 9/10 (高度相关)