摘要
声源定位任务旨在利用音视频模态间的相关性识别发声物体位置。现有方法多依赖对比学习特征匹配,缺乏显式推理与验证,限制了其在复杂声学场景中的效果。受人类元认知过程启发,本文提出一种无需训练的定位框架,利用多模态大语言模型(MLLM)的内在推理能力。该框架包含生成 - 分析 - 优化(GAR)流程:生成阶段产出初始边界框与音频分类;分析阶段通过开放集角色标记与锚点投票量化音视一致性;优化阶段应用自适应门控避免不必要调整。实验表明该方法在单源及多源基准上具有竞争力。
AI 推荐理由
论文核心提出基于 MLLM 元推理的框架,显式利用模型的内在推理能力解决定位任务。
研究机构
Kyung Hee University
论文信息