多模态检索 推理基准 音频理解 模型评估
摘要

随着多模态内容激增,音频检索成为关键技术,但现有基准多局限于语义匹配,忽视了现实查询对否定理解、时序排序等高级推理能力的需求。为此,本文提出 ReasonAudio,首个面向文本 - 音频检索的强推理基准,涵盖否定、顺序、重叠、时长及混合五项任务。实验表明,当前模型在推理密集型检索中表现不佳,且多模态大语言模型未能通过对比微调继承其骨干网络的推理能力,揭示了现有训练范式的不足。

AI 推荐理由

论文构建基准评估多模态检索中的高级推理能力,核心聚焦于推理机制的评测与分析。

研究机构
School of Software, Nanjing University School of Software, Northwestern Polytechnical University College of Computing and Data Science, Nanyang Technological University
论文信息
作者 Honglei Zhang, Yuting Chen, Chenpeng Hu, Siyue Zhang, Yilei Shi
发布日期 2026-05-05
arXiv ID 2605.03361
相关性评分 9/10 (高度相关)