摘要
人类在对话倾听时会潜意识地并发思考,这对形成高质量回应至关重要。受此启发,本文提出全双工潜在内部推理方法(FLAIR),能在语音感知同时进行潜在思考。与传统需事后生成的机制不同,该方法在用户说话阶段递归反馈潜在嵌入,实现严格遵循因果律且无额外延迟的连续推理。为此,我们设计了基于证据下界的目标函数,支持无需显式推理标注的高效监督微调。实验表明,该“边听边想”设计在多项语音基准测试中表现优异,并能稳健处理对话动态。
AI 推荐理由
论文提出 FLAIR 方法,核心在于建模全双工对话中的潜在推理机制,实现边听边想。
研究机构
清华大学
新加坡国立大学
蒙特利尔大学
论文信息