摘要
现实世界的音视频理解需要串联稀疏、时间分散且跨模态的证据,而现有基准未能有效评估此能力。本文提出 TraceAV-Bench,首个联合评估长音视频轨迹多跳推理及多模态幻觉鲁棒性的基准。该数据集包含 578 个长视频(共 339.5 小时)中的 2200 个严格验证的多选题,问题基于平均跨越 15.1 分钟、3.68 跳的显式推理链。对多个 OmniLLM 的评估显示,即使最强模型在该基准上也面临巨大挑战,且多模态幻觉鲁棒性与通用推理性能 largely 解耦。
AI 推荐理由
论文核心聚焦于长音频视频中的多跳轨迹推理能力评估,直接针对推理机制。
研究机构
北京大学
中国科学院自动化研究所
北京理工大学
论文信息