Audio-Language Models Streaming Reasoning Reinforcement Learning Latency Optimization
摘要

针对大型音频语言模型(LALMs)在实时流式交互中推理质量与响应速度的矛盾,本文提出一种可学习的“等待 - 思考 - 回答”控制框架。该控制器依据部分音频证据,动态决定何时等待、何时输出紧凑的推理更新以及何时作答。基于 Qwen2.5-Omni-7B,通过监督微调构建对齐轨迹,并利用结合多维奖励的 DAPO 算法优化完整轨迹。实验表明,该方法在合成基准上提升了准确率并显著减少了端点后推理长度,证明了流式模型学习中间显式推理时机的重要性。

AI 推荐理由

论文核心研究流式音频交互中何时进行显式推理的决策机制,直接优化推理质量与延迟。

研究机构
University of Pennsylvania
论文信息
作者 Zhiyuan Song, Weici Zhao, Yang Xiao, Suhao Yu, Cheng Zhu et al.
发布日期 2026-05-26
arXiv ID 2605.27190
相关性评分 9/10 (高度相关)