Video-Language Models Temporal Reasoning Model Merging Layer Selection
摘要

多模态适配虽赋予大语言模型感知能力,却常削弱其原有的推理能力,这在视频 - 语言模型中尤为显著,视觉对齐可能损害对序列事件的时间推理。本文提出 MERIT,一种无需训练、任务驱动的模型合并框架,旨在恢复时间推理能力。该方法在视频模型与文本骨干网络的自注意力层间搜索最优合并策略,在提升推理的同时抑制感知退化。实验表明,MERIT 在多个基准上显著改善时间推理并保持感知能力,且优于均匀合并与随机选择,证实特定层级对推理至关重要。

AI 推荐理由

论文核心聚焦于恢复视频语言模型的时间推理能力,通过层级选择机制直接优化推理表现。

研究机构
National University of Singapore MBZUAI
论文信息
作者 Zihang Fu, Haonan Wang, Jian Kang, Kenji Kawaguchi, Jiaying Wu
发布日期 2026-04-13
arXiv ID 2604.11399
相关性评分 9/10 (高度相关)