Audio-Visual LLM Chain-of-Thought Cross-Modal Interference Hallucination Mitigation
摘要

针对音视频大语言模型中因跨模态交互失控导致的干扰与幻觉问题,本文提出“先分后融”(SFFL)推理框架。该方法强制实施模态特定的思维链推理,生成独立的音频与视觉推理轨迹,并在证据融合阶段整合信息。通过构建模态偏好标签作为强化学习的辅助奖励,鼓励模型根据实例动态偏好模态线索。实验表明,该机制在保持模态隔离的同时有效利用跨模态信息,显著提升了通用基准及抗幻觉基准上的准确率与鲁棒性。

AI 推荐理由

论文提出模态特定思维链机制,核心解决多模态推理中的干扰与幻觉问题。

研究机构
Tianjin Key Laboratory of Cognitive Computing and Application, Tianjin University, Tianjin, China
论文信息
作者 Xuanchen Li, Yuheng Lu, Chenrui Cui, Tianrui Wang, Zikang Huang et al.
发布日期 2026-05-11
arXiv ID 2605.09906
相关性评分 9/10 (高度相关)