Speech Recognition Chain-of-Thought Multimodal Learning LLM
摘要

尽管引入了语音输入扩展,但在自动语音识别(ASR)中有效利用大语言模型(LLM)的丰富知识与上下文理解仍具挑战,因该任务主要涉及直接的语音到文本映射。为此,本文提出思维链 ASR(CoT-ASR),构建推理链使 LLM 先分析输入语音并生成上下文分析,从而充分利用其生成能力。基于此上下文推理,CoT-ASR 执行更明智的语音识别,在单次传递中完成推理与转录。此外,该方法天然支持用户引导的转录,可无缝整合用户提供的上下文以指导转录。为缩小模态差距,本文引入 CTC 引导的模态适配器,利用 CTC 非空白令牌概率加权 LLM 嵌入,高效对齐语音编码器输出与 LLM 文本潜在空间。实验表明,相比标准基于 LLM 的 ASR,CoT-ASR 的词错误率相对降低 8.7%,实体错误率相对降低 16.9%。

AI 推荐理由

论文提出思维链 ASR,核心利用 LLM 上下文推理能力增强语音识别,属推理机制研究。

研究机构
Microsoft Core AI, USA
论文信息
作者 Keqi Deng, Ruchao Fan, Bo Ren, Yiming Wang, Jinyu Li
发布日期 2026-04-01
arXiv ID 2604.00610
相关性评分 9/10 (高度相关)