摘要
针对大型音频语言模型(LALMs)在实时流式交互中推理质量与响应速度的矛盾,本文提出一种可学习的“等待 - 思考 - 回答”控制框架。该控制器依据部分音频证据,动态决定何时等待、何时输出紧凑的推理更新以及何时作答。基于 Qwen2.5-Omni-7B,通过监督微调构建对齐轨迹,并利用结合多维奖励的 DAPO 算法优化完整轨迹。实验表明,该方法在合成基准上提升了准确率并显著减少了端点后推理长度,证明了流式模型学习中间显式推理时机的重要性。
AI 推荐理由
论文核心研究流式音频交互中何时进行显式推理的决策机制,直接优化推理质量与延迟。
研究机构
University of Pennsylvania
论文信息