摘要
语音大模型(SLLM)在复杂推理任务上表现不及文本模型。研究发现这种模态差距并非均匀的认知缺陷:在空间、句法和事实任务中,语音转文本表现相当甚至更优;但在需实体追踪的逻辑任务中,准确率骤降至随机水平。诊断表明这是“实体绑定失败”,即连续语音特征导致隐式推理中实体 - 属性关联丢失。为此,作者提出实体感知思维链(EA-CoT),强制模型在推理前显式枚举并绑定实体。实验显示该方法显著缩小模态差距,即使存在识别错误也能提升高达 24.4% 的准确率。
AI 推荐理由
论文核心研究语音大模型在逻辑推理中的实体绑定失败问题,并提出思维链干预方法。
研究机构
School of Data Science, The Chinese University of Hong Kong, Shenzhen, China
ByteDance, China
论文信息