摘要
本文针对 CVPR 2026 EgoVis 跨域自我中心视频挑战,将任务定义为鲁棒的具身视频推理问题。针对时序边界模糊、跨域语义粒度不匹配及近选项决策不稳定三大挑战,提出了 OmniEgo-R$^2$统一路由推理框架。该框架包含时序证据归一化、领域无关能力路由、结构化感知 - 动态 - 决策推理等模块,并以 Qwen3-VL-4B-SFT 为视觉语言骨干。最终在源限制和开源赛道均获第二名,验证了其在复杂多模态推理任务中的有效性。
AI 推荐理由
论文提出路由推理框架,核心解决多模态视频中的时序、跨域及决策推理难题。
研究机构
Shandong University
Harbin Institute of Technology (Shenzhen)
论文信息