摘要
TimeLogicQA 旨在评估视频问答系统对事件存在、顺序、持续性等时序关系的推理能力。本文提出一种视觉证据路由流程,将感知与符号时序推理分离。系统首先解析问题要素,随后根据视频时长和算子难度路由证据:短视频采用有序全帧证据,长视频则聚焦事件候选窗口。多模态大语言模型生成结构化视觉证据,程序化验证器恢复密集动作区间,确定性归约器应用时序规则得出最终答案。保守融合机制仅在多方一致时接受答案,有效减少噪声干扰,在官方测试中平均准确率达 81.8%。
AI 推荐理由
论文核心解决视频问答中的时序逻辑推理问题,提出符号化推理架构。
研究机构
东南大学
国家自然科学基金委员会
奥普斯人工智能研究院
论文信息