摘要
针对多模态大模型处理长视频时存在的序列过长及冗余帧问题,现有方法多依赖被动识别或固定工作流。本文提出 EVA,一种基于高效强化学习的端到端视频代理框架。该框架通过“总结 - 规划 - 行动 - 反思”的迭代推理机制,实现“规划先行”,使代理能自主决策观察内容与时机。我们设计了包含监督微调、KTO 及 GRPO 的三阶段训练流程,并构建相应数据集。在六个基准测试中,EVA 显著优于通用基线及现有自适应代理方法。
AI 推荐理由
论文核心提出“规划先行”机制,通过迭代推理自主决定观察策略,属规划能力研究。
研究机构
SenseTime Research
论文信息