Multimodal Reasoning Reinforcement Learning Modality Collapse Audio LLM
摘要

音频及全模态大语言模型虽具备跨模态推理能力,但在标准强化学习后训练中易出现结构性漏洞:均匀的策略梯度忽略了 token 对非文本模态的依赖差异,导致长思维链生成中发生后期模态坍塌,模型放弃源信号而产生幻觉。为此,本文提出模态感知策略优化(MAPO)框架。该方法利用模态相关性掩码动态聚焦关键 token 的策略梯度,并引入辅助注意力损失分支,确保模型在深层推理中维持跨模态 grounding。实验表明,MAPO 显著提升了复杂音频推理的长程保真度与指令遵循能力,在多个基准测试中创下开源模型新纪录。

AI 推荐理由

论文核心解决多模态推理中的模态坍塌问题,通过新算法提升长程推理保真度。

研究机构
约翰霍普金斯大学 腾讯混元
论文信息
作者 Cihan Xiao, Yiwen Shao, Chenxing Li, Xiang He, Zhenwen Liang et al.
发布日期 2026-05-26
arXiv ID 2605.27741
相关性评分 9/10 (高度相关)