摘要
大型音频语言模型(LALM)虽能回答关于语音、音乐及环境声音的问题,但其内部推理过程往往不透明且难以验证。本文介绍了 TalTech 在 Interspeech 2026 音频推理挑战赛智能体赛道中的解决方案,该系统重点评估推理过程的质量,包括事实准确性、逻辑严密性及推理链的完整性。我们提出了一种多源集成流水线,利用两个 LALM 生成独立观测,并由纯文本推理模型将这些观测与 25 种按可靠性分级的声学工具输出进行交叉验证。通过将每个推理步骤建立在明确的、标记可靠性的证据之上,系统生成了密集且可验证的推理链。该系统在挑战赛中排名第一,在推理质量指标上大幅领先其他竞争系统。
AI 推荐理由
论文核心聚焦于提升音频问答中的推理链质量,通过多源证据融合实现可验证的逻辑推理。
研究机构
塔尔图理工大学,爱沙尼亚
论文信息