multi-modal learning self-supervised learning collaborative reasoning video-audio understanding
摘要

本文提出 OmniJigsaw,一种基于时间重排序代理任务的通用自监督框架,旨在将强化学习后训练范式扩展至全模态模型,以同时增强视频 - 音频理解与协同推理。该框架通过联合模态整合、样本级模态选择和片段级模态掩码三种策略,强制模型进行跨模态融合。针对代理任务对数据质量的依赖,设计了粗到细的两阶段数据过滤流水线。实验表明,细粒度片段级掩码能有效缓解“双模态捷径”现象,在 15 个基准测试中显著提升了视频、音频及协同推理性能。

AI 推荐理由

论文核心旨在通过多模态重排序任务增强视听协同推理能力,直接针对推理机制。

研究机构
浙江大学 清华大学
论文信息
作者 Yiduo Jia, Muzhi Zhu, Hao Zhong, Mingyu Liu, Yuling Xi et al.
发布日期 2026-04-09
arXiv ID 2604.08209
相关性评分 9/10 (高度相关)