摘要
针对全模态大语言模型在多跳音视频推理中面临的证据稀疏、时间分散及跨模态分布等挑战,本文提出了 MOV-Bench 基准测试集,包含 519 个需跨时序音视频证据进行多步推理的问题。评估显示现有模型在此任务上表现不佳。为此,作者提出了 AOP-Agent,一种基于开源全模态模型的高效代理框架。该框架结合分层全模态记忆与协作式的“观察 - 反思 - 重规划”循环,使模型无需额外训练即可实现主动感知。实验表明,AOP-Agent 在长视频及高推理密度问题上显著提升了推理性能。
AI 推荐理由
论文核心解决多跳音视频推理难题,提出主动感知框架显著提升推理性能。
研究机构
上海交通大学
论文信息