Multimodal Large Language Models Sound Source Localization Meta-Reasoning Training-Free
摘要

声源定位任务旨在利用音视频模态间的相关性识别发声物体位置。现有方法多依赖对比学习特征匹配,缺乏显式推理与验证,限制了其在复杂声学场景中的效果。受人类元认知过程启发,本文提出一种无需训练的定位框架,利用多模态大语言模型(MLLM)的内在推理能力。该框架包含生成 - 分析 - 优化(GAR)流程:生成阶段产出初始边界框与音频分类;分析阶段通过开放集角色标记与锚点投票量化音视一致性;优化阶段应用自适应门控避免不必要调整。实验表明该方法在单源及多源基准上具有竞争力。

AI 推荐理由

论文核心提出基于 MLLM 元推理的框架,显式利用模型的内在推理能力解决定位任务。

研究机构
Kyung Hee University
论文信息
作者 Subin Park, Jung Uk Kim
发布日期 2026-04-08
arXiv ID 2604.06824
相关性评分 9/10 (高度相关)