Multimodal Summarization Chain-of-Thought Event Graph Temporal Reasoning
摘要

多模态摘要旨在整合视频、转录文本和图像信息生成简洁文本。针对现有方法依赖特定领域监督、跨模态 grounding 弱及缺乏事件时序建模等挑战,本文提出 CoE 框架。该方法利用分层事件图将文本语义编码为显式事件层级,引导跨模态定位与时序推理,通过事件演化与因果过渡分析,结合轻量级风格适配优化输出。实验表明,CoE 在八个数据集上显著优于现有视频思维链基线,展现了卓越的鲁棒性与泛化能力。

AI 推荐理由

论文提出基于事件链的结构化推理框架,核心解决多模态时序与因果推理问题。

研究机构
杭州电子科技大学计算机学院 深圳职业技术学院智能科学与工程学院 中国科学技术大学信息科学与技术学院
论文信息
作者 Xiaoxing You, Qiang Huang, Lingyu Li, Xiaojun Chang, Jun Yu
发布日期 2026-03-06
arXiv ID 2603.06213
相关性评分 9/10 (高度相关)