多模态推理 视频理解 自适应检索 强化学习
摘要

近期视频多模态大语言模型虽结合了逐步推理与按需视觉证据检索,但仍存在采样密度不可学习、检索与生成奖励耦合两大结构缺陷。本文提出 DynFrame 框架,将时间窗口与采样密度作为原生令牌在单次自回归中输出,实现可学习的跨度 - 密度检索。此外,引入段解耦 GRPO 算法,在检索边界分割轨迹并分配角色特定的令牌级优势,分别评估采样决策与答案生成。实验表明,该模型在多个基准测试中表现优异,刷新了多项最先进记录。

AI 推荐理由

论文核心提出自适应推理驱动框架,通过动态帧增强优化多模态推理中的证据检索与生成过程。

研究机构
浙江大学 阿里巴巴集团
论文信息
作者 Peng Zhang, Guanghao Zhang, Wanggui He, Longxiang Zhang, Mushui Liu et al.
发布日期 2026-05-26
arXiv ID 2605.26680
相关性评分 9/10 (高度相关)