摘要
针对音视频大语言模型中因跨模态交互失控导致的干扰与幻觉问题,本文提出“先分后融”(SFFL)推理框架。该方法强制实施模态特定的思维链推理,生成独立的音频与视觉推理轨迹,并在证据融合阶段整合信息。通过构建模态偏好标签作为强化学习的辅助奖励,鼓励模型根据实例动态偏好模态线索。实验表明,该机制在保持模态隔离的同时有效利用跨模态信息,显著提升了通用基准及抗幻觉基准上的准确率与鲁棒性。
AI 推荐理由
论文提出模态特定思维链机制,核心解决多模态推理中的干扰与幻觉问题。
研究机构
Tianjin Key Laboratory of Cognitive Computing and Application, Tianjin University, Tianjin, China
论文信息