摘要
音频及全模态大语言模型虽具备跨模态推理能力,但在标准强化学习后训练中易出现结构性漏洞:均匀的策略梯度忽略了 token 对非文本模态的依赖差异,导致长思维链生成中发生后期模态坍塌,模型放弃源信号而产生幻觉。为此,本文提出模态感知策略优化(MAPO)框架。该方法利用模态相关性掩码动态聚焦关键 token 的策略梯度,并引入辅助注意力损失分支,确保模型在深层推理中维持跨模态 grounding。实验表明,MAPO 显著提升了复杂音频推理的长程保真度与指令遵循能力,在多个基准测试中创下开源模型新纪录。
AI 推荐理由
论文核心解决多模态推理中的模态坍塌问题,通过新算法提升长程推理保真度。
研究机构
约翰霍普金斯大学
腾讯混元
论文信息