Multi-hop Reasoning Audio-Visual Benchmark OmniLLM Hallucination Robustness
摘要

现实世界的音视频理解需要串联稀疏、时间分散且跨模态的证据,而现有基准未能有效评估此能力。本文提出 TraceAV-Bench,首个联合评估长音视频轨迹多跳推理及多模态幻觉鲁棒性的基准。该数据集包含 578 个长视频(共 339.5 小时)中的 2200 个严格验证的多选题,问题基于平均跨越 15.1 分钟、3.68 跳的显式推理链。对多个 OmniLLM 的评估显示,即使最强模型在该基准上也面临巨大挑战,且多模态幻觉鲁棒性与通用推理性能 largely 解耦。

AI 推荐理由

论文核心聚焦于长音频视频中的多跳轨迹推理能力评估,直接针对推理机制。

研究机构
北京大学 中国科学院自动化研究所 北京理工大学
论文信息
作者 Hengyi Feng, Hao Liang, Mingrui Chen, Bohan Zeng, Meiyi Qiang et al.
发布日期 2026-05-08
arXiv ID 2605.07593
相关性评分 9/10 (高度相关)