video understanding reasoning dataset knowledge-intensive chain-of-thought
摘要

本文介绍了 VideoKR,这是首个专为增强知识与推理密集型视频理解而设计的大规模训练语料库。该语料库包含基于 14.5 万新收集视频生成的 31.5 万个视频推理样本。作者开发了一种人机协同、面向技能的样本生成流程,旨在逐步深化视频推理能力,同时确保样本及其思维链(CoT)理由的难度、多样性与可靠性。此外,还构建了专家标注的基准 VideoKR-Eval,其问题要求真正的视频理解与知识密集型推理,而非文本捷径。实验表明,在标准 SFT 到 GRPO 流程下,经 VideoKR 后训练的模型在知识密集型视频推理任务上优于以往方法,且在通用视频推理上保持竞争力,凸显了数据设计对推动视频推理进步的关键作用。

AI 推荐理由

论文核心聚焦于构建知识密集与推理密集的视频理解数据集,旨在提升模型的逻辑推理能力。

研究机构
Zhejiang University, Hangzhou, Zhejiang, China Yilun Zhao
论文信息
作者 Lin Fu, Zheyuan Yang, Yang Wang, Tingyu Song, Arman Cohan et al.
发布日期 2026-06-03
arXiv ID 2606.05259
相关性评分 9/10 (高度相关)