摘要
随着多模态内容激增,音频检索成为关键技术,但现有基准多局限于语义匹配,忽视了现实查询对否定理解、时序排序等高级推理能力的需求。为此,本文提出 ReasonAudio,首个面向文本 - 音频检索的强推理基准,涵盖否定、顺序、重叠、时长及混合五项任务。实验表明,当前模型在推理密集型检索中表现不佳,且多模态大语言模型未能通过对比微调继承其骨干网络的推理能力,揭示了现有训练范式的不足。
AI 推荐理由
论文构建基准评估多模态检索中的高级推理能力,核心聚焦于推理机制的评测与分析。
研究机构
School of Software, Nanjing University
School of Software, Northwestern Polytechnical University
College of Computing and Data Science, Nanyang Technological University
论文信息