摘要
针对现有视频智能体依赖密集采样帧导致计算成本高昂的问题,本文提出 VideoSeek。该长程视频智能体利用视频逻辑流主动寻找关键证据,而非穷尽解析全片。通过精心设计的工具集和“思考 - 行动 - 观察”循环,模型实现了查询感知的探索。实验表明,VideoSeek 在大幅减少帧使用量(减少 93%)的同时,显著提升了视频理解与推理的准确性,在 LVBench 上较基线提升 10.2 分。
AI 推荐理由
论文核心在于利用视频逻辑流进行主动搜索和任务规划,以替代贪婪解析,属于典型的长程规划研究。
研究机构
AMD
罗切斯特大学
论文信息