Video Reasoning Robustness Self-Reflective Training Benchmark
摘要

针对视觉语言模型在真实场景(如天气、遮挡)中理解与推理能力显著下降的问题,本文提出 ROVA 训练框架。该框架通过建模时空扰动下的鲁棒性感知一致性奖励,并结合基于自我反思评估的难度感知在线策略,实现自适应训练以增强鲁棒性。此外,文章引入 PVRBench 基准测试集,注入真实扰动以评估模型表现。实验表明,ROVA 显著缓解了性能退化,在多个基准上大幅提升了准确率与推理质量。

AI 推荐理由

论文核心解决视频模型在扰动下的推理退化问题,提出增强推理鲁棒性的框架。

研究机构
NTU Singapore 韩国大学
论文信息
作者 Yangfan He, Changgyu Boo, Jaehong Yoon
发布日期 2026-03-11
arXiv ID 2603.10652
相关性评分 9/10 (高度相关)