摘要
大型音频语言模型(ALM)通常冻结 LLM 仅训练适配器,但这会导致推理模型(RLM)因思维链暴露文本 surrogate 输入而产生不自然响应。本文提出自复述方法,将自生成响应转换为兼容 RLM 的音频理解变体,同时保持分布对齐。此外,融合并压缩多个音频编码器以增强表征。基于包含 19000 小时语音、音乐和声音的 600 万实例多任务语料库训练的 4B 参数模型,在相关音频推理基准上超越同类及多数更大模型,且在保留文本能力的同时降低了训练成本。
AI 推荐理由
论文专为推理模型设计,解决音频输入下的思维链暴露问题,核心提升推理能力。
研究机构
EPFL, Switzerland
Sony Europe Ltd., Germany
论文信息