摘要
尽管引入了语音输入扩展,但在自动语音识别(ASR)中有效利用大语言模型(LLM)的丰富知识与上下文理解仍具挑战,因该任务主要涉及直接的语音到文本映射。为此,本文提出思维链 ASR(CoT-ASR),构建推理链使 LLM 先分析输入语音并生成上下文分析,从而充分利用其生成能力。基于此上下文推理,CoT-ASR 执行更明智的语音识别,在单次传递中完成推理与转录。此外,该方法天然支持用户引导的转录,可无缝整合用户提供的上下文以指导转录。为缩小模态差距,本文引入 CTC 引导的模态适配器,利用 CTC 非空白令牌概率加权 LLM 嵌入,高效对齐语音编码器输出与 LLM 文本潜在空间。实验表明,相比标准基于 LLM 的 ASR,CoT-ASR 的词错误率相对降低 8.7%,实体错误率相对降低 16.9%。
AI 推荐理由
论文提出思维链 ASR,核心利用 LLM 上下文推理能力增强语音识别,属推理机制研究。
研究机构
Microsoft Core AI, USA
论文信息