摘要
本文提出 OmniJigsaw,一种基于时间重排序代理任务的通用自监督框架,旨在将强化学习后训练范式扩展至全模态模型,以同时增强视频 - 音频理解与协同推理。该框架通过联合模态整合、样本级模态选择和片段级模态掩码三种策略,强制模型进行跨模态融合。针对代理任务对数据质量的依赖,设计了粗到细的两阶段数据过滤流水线。实验表明,细粒度片段级掩码能有效缓解“双模态捷径”现象,在 15 个基准测试中显著提升了视频、音频及协同推理性能。
AI 推荐理由
论文核心旨在通过多模态重排序任务增强视听协同推理能力,直接针对推理机制。
研究机构
浙江大学
清华大学
论文信息