Video Reasoning Data Annotation Agentic Pipeline Vision Language Models
摘要

本文提出 MAVEN,一种多阶段智能体视频事件标注管线,旨在将原始视频转化为包含思维链推理轨迹的高质量结构化训练数据。其核心是通过三层互补描述合成多尺度时空事件描述,作为下游问答生成的唯一输入。该管线支持智能体驱动的领域自适应,能自动重构提示词;并通过分层优化循环分类错误、追溯根源并迭代改进数据质量。在交通视频数据上的实验表明,基于此数据微调的模型在多项基准测试中显著超越现有基线。

AI 推荐理由

论文核心是构建视频推理任务的数据标注管线,生成思维链数据以训练模型推理能力。

研究机构
NVIDIA
论文信息
作者 Han Zhang, Wanting Jiang, Tomasz Kornuta, Tian Zheng, Vidya Murali
发布日期 2026-05-21
arXiv ID 2605.21917
相关性评分 9/10 (高度相关)