摘要
针对视觉语言模型在真实场景(如天气、遮挡)中理解与推理能力显著下降的问题,本文提出 ROVA 训练框架。该框架通过建模时空扰动下的鲁棒性感知一致性奖励,并结合基于自我反思评估的难度感知在线策略,实现自适应训练以增强鲁棒性。此外,文章引入 PVRBench 基准测试集,注入真实扰动以评估模型表现。实验表明,ROVA 显著缓解了性能退化,在多个基准上大幅提升了准确率与推理质量。
AI 推荐理由
论文核心解决视频模型在扰动下的推理退化问题,提出增强推理鲁棒性的框架。
研究机构
NTU Singapore
韩国大学
论文信息