Video Agent Reinforcement Learning Planning Multimodal LLM
摘要

针对多模态大模型处理长视频时存在的序列过长及冗余帧问题,现有方法多依赖被动识别或固定工作流。本文提出 EVA,一种基于高效强化学习的端到端视频代理框架。该框架通过“总结 - 规划 - 行动 - 反思”的迭代推理机制,实现“规划先行”,使代理能自主决策观察内容与时机。我们设计了包含监督微调、KTO 及 GRPO 的三阶段训练流程,并构建相应数据集。在六个基准测试中,EVA 显著优于通用基线及现有自适应代理方法。

AI 推荐理由

论文核心提出“规划先行”机制,通过迭代推理自主决定观察策略,属规划能力研究。

研究机构
SenseTime Research
论文信息
作者 Yaolun Zhang, Ruohui Wang, Jiahao Wang, Yepeng Tang, Xuanyu Zheng et al.
发布日期 2026-03-24
arXiv ID 2603.22918
相关性评分 9/10 (高度相关)