test-time adaptation video reasoning reinforcement learning multimodal understanding
摘要

近期视频推理模型虽在时序与多模态理解上表现优异,但依赖大规模监督数据且训练成本高。本文提出 TTA-Vid,利用测试时强化学习范式,使预训练模型能在无标签情况下适应新视频样本。该方法结合两步机制:一是在推理时对多帧子集进行逐步推理,利用基于频率的奖励更新模型;二是采用多臂老虎机策略自适应选择信息量大的帧。实验表明,该方法无需真实标注即可在多种视频推理任务中超越现有最先进方法。

AI 推荐理由

论文核心聚焦视频推理,提出测试时自适应方法提升多步推理能力。

研究机构
University of Tübingen MIT IBM Research Max Planck Institute for Informatics, SIC MIT-IBM Watson AI Lab
论文信息
作者 Soumya Shamarao Jahagirdar, Edson Araujo, Anna Kukleva, M. Jehanzeb Mirza, Saurabhchand Bhati et al.
发布日期 2026-04-01
arXiv ID 2604.00696
相关性评分 9/10 (高度相关)