摘要
视觉 - 语言模型在静态图像理解上进展显著,但在时空推理方面仍面临严峻挑战,主要瓶颈是“多图像推理幻觉”。为缓解此问题,本文构建了新的思维链数据集,将复杂推理分解为详细的时空步骤与明确判断。在此基础上,提出渐进式训练框架:先在 CoT 数据上进行监督预训练以植入逻辑结构,再利用可扩展的弱标记数据微调以增强泛化能力。实验表明,该方法不仅提升了基座模型准确率,更将前后向性能差距从超 70% 降至 6.53%,有效培养了真实的动态推理能力并减少了时间偏差。
AI 推荐理由
论文核心解决具身推理中的时空幻觉,通过思维链数据集提升因果理解能力。
研究机构
香港中文大学
清华大学
论文信息