摘要
本文提出了 MMCOMET,这是首个整合物理、社会和事件知识的多模态常识知识图谱(MMKG)。通过高效的图像检索过程,MMCOMET 扩展了 ATOMIC2020 知识图谱以包含视觉维度,生成了超过 90 万条多模态三元组。该资源解决了现有 MMKG 在支持图像描述和故事讲述等复杂推理任务方面的主要局限。标准的视觉故事讲述实验表明,这种整体方法能够生成比仅使用文本知识更丰富、连贯且基于上下文的故事,为多模态常识推理和叙事生成奠定了新基础。
AI 推荐理由
论文构建多模态常识图谱以支持复杂推理任务,核心聚焦于提升上下文推理能力。
研究机构
悉尼大学
达姆施塔特工业大学
墨尔本大学
爱丁堡大学
论文信息