Video Understanding Knowledge Graph Multi-hop Reasoning Long-context Agentic Framework
摘要

本文介绍了我们在 CVPR 2026 EgoVis 研讨会 CASTLE 挑战赛中荣获全球第三名的方法。该挑战要求在海量多模态视频流中回答复杂的视觉、时空及语言问题。为应对极端规模与长上下文需求,我们提出了一种无需训练的代理框架。其核心包含两部分:一是映射实体及其时空关系的视频知识图谱,以支持多跳关系推理;二是通过分层检索与索引解析复杂查询的自适应代理工作流。实证结果表明,该框架在长上下文多视角流上实现了高精度的零样本推理。

AI 推荐理由

论文核心提出基于知识图谱的多跳关系推理架构,解决长视频复杂时空推理问题。

研究机构
TAHAKOM
论文信息
作者 Raghad Albusayes, Munirah Alyahya
发布日期 2026-06-01
arXiv ID 2606.01933
相关性评分 9/10 (高度相关)