Video Reasoning Knowledge Fusion Multi-Agent RAG Visual Space
摘要

针对多模态大模型在视频推理中引入外部知识时面临的注意力稀释与认知负荷过高问题,本文提出 Graph-to-Frame RAG(G2F-RAG)。这是一种免训练且可审计的范式,旨在视觉空间内交付知识。离线阶段,代理构建包含实体、事件及世界知识的视频知识图谱;在线阶段,分层多智能体控制器判断需求,检索最小子图并渲染为单一推理帧附加至视频。该方法使模型在统一视觉域内进行联合推理,显著降低认知负荷并提供可追溯的证据链,在各类基准测试中表现优异。

AI 推荐理由

论文核心解决视频推理中的知识融合瓶颈,提出视觉空间知识融合新范式以增强推理能力。

研究机构
National University of Defense Technology Sun Yat-sen University
论文信息
作者 Songyuan Yang, Weijiang Yu, Ziyu Liu, Guijian Tang, Wenjing Yang et al.
发布日期 2026-04-06
arXiv ID 2604.04372
相关性评分 9/10 (高度相关)