Video Question Answering Relational Reasoning Adaptive Computation
摘要

VRR-QA 旨在评估视频 - 语言系统推断空间、时间、视角等复杂关系的能力。本文提出一种仅推理系统,采用自适应测试时计算策略:首先通过直接模型pass生成初始答案,利用轻量级视图识别不稳定问题;仅将此类难题路由至高预算密集证据模块,该模块构建时间戳帧观测、关系特定探针及保守时间聚合。该方法有效区分了寻找替代答案与决定何时修正答案两个关键问题,在测试集上取得了优异的准确率。

AI 推荐理由

论文核心解决视频关系推理问题,提出自适应证据细化机制以提升推理准确性。

研究机构
Southeast University National University of Singapore Independent Researcher Opus AI Research University of Science and Technology of China
论文信息
作者 Yuyang Sun, Yongliang Wu, Xingyu Zhu, Yuxia Chen, Zhenxiang Jiang et al.
发布日期 2026-05-31
arXiv ID 2606.01104
相关性评分 9/10 (高度相关)