Chain-of-Thought Model Steering Audio-Language Models Training-Free Cross-modal Transfer
摘要

思维链(CoT)提示已扩展至大型音频语言模型(LALM)以激发推理,但在无需训练的情况下提升其有效性仍具挑战。本研究探讨推理时的模型引导作为一种无训练方法,旨在改善 LALM 的推理表现。我们提出了利用多样化信息源的三种策略,并在四个 LALM 和四个基准测试中进行评估。结果显示,相较于传统 CoT 提示,准确率普遍提升高达 4.4%。值得注意的是,我们发现了一种跨模态迁移现象:源自少量文本样本的引导向量能有效指导基于语音的推理,展现出极高的数据效率。此外,我们还考察了超参数敏感性以理解这些方法的鲁棒性。研究结果将模型引导定位为增强 LALM 推理能力的实用方向。

AI 推荐理由

论文核心研究通过无训练模型引导增强大型音频语言模型的思维链推理能力。

研究机构
国立台湾大学
论文信息
作者 Lok-Lam Ieong, Chia-Chien Chen, Chih-Kai Yang, Yu-Han Huang, An-Yu Cheng et al.
发布日期 2026-03-15
arXiv ID 2603.14636
相关性评分 9/10 (高度相关)