Audio-Language Models Reasoning Chain-of-Thought Multimodal Alignment
摘要

大型音频语言模型(ALM)通常冻结 LLM 仅训练适配器,但这会导致推理模型(RLM)因思维链暴露文本 surrogate 输入而产生不自然响应。本文提出自复述方法,将自生成响应转换为兼容 RLM 的音频理解变体,同时保持分布对齐。此外,融合并压缩多个音频编码器以增强表征。基于包含 19000 小时语音、音乐和声音的 600 万实例多任务语料库训练的 4B 参数模型,在相关音频推理基准上超越同类及多数更大模型,且在保留文本能力的同时降低了训练成本。

AI 推荐理由

论文专为推理模型设计,解决音频输入下的思维链暴露问题,核心提升推理能力。

研究机构
EPFL, Switzerland Sony Europe Ltd., Germany
论文信息
作者 Petr Grinberg, Hassan Shahmohammadi
发布日期 2026-03-10
arXiv ID 2603.09556
相关性评分 9/10 (高度相关)