摘要
多模态摘要旨在整合视频、转录文本和图像信息生成简洁文本。针对现有方法依赖特定领域监督、跨模态 grounding 弱及缺乏事件时序建模等挑战,本文提出 CoE 框架。该方法利用分层事件图将文本语义编码为显式事件层级,引导跨模态定位与时序推理,通过事件演化与因果过渡分析,结合轻量级风格适配优化输出。实验表明,CoE 在八个数据集上显著优于现有视频思维链基线,展现了卓越的鲁棒性与泛化能力。
AI 推荐理由
论文提出基于事件链的结构化推理框架,核心解决多模态时序与因果推理问题。
研究机构
杭州电子科技大学计算机学院
深圳职业技术学院智能科学与工程学院
中国科学技术大学信息科学与技术学院
论文信息