摘要
VRR-QA 旨在评估视频 - 语言系统推断空间、时间、视角等复杂关系的能力。本文提出一种仅推理系统,采用自适应测试时计算策略:首先通过直接模型pass生成初始答案,利用轻量级视图识别不稳定问题;仅将此类难题路由至高预算密集证据模块,该模块构建时间戳帧观测、关系特定探针及保守时间聚合。该方法有效区分了寻找替代答案与决定何时修正答案两个关键问题,在测试集上取得了优异的准确率。
AI 推荐理由
论文核心解决视频关系推理问题,提出自适应证据细化机制以提升推理准确性。
研究机构
Southeast University
National University of Singapore
Independent Researcher
Opus AI Research
University of Science and Technology of China
论文信息