摘要
本文针对深度学习中的域泛化问题,提出利用多模态大语言模型的推理能力构建推理链以推导图像类别,从而实现更鲁棒的预测。研究揭示了直接微调推理链面临的优化挑战及语义丰富性与效率间的权衡。为此,作者提出了 RD-MLDG 框架,包含多任务交叉训练和自对齐推理正则化两个组件,旨在引导推理监督并缓解模式不匹配。实验表明该方法在多个数据集上达到了最先进水平,证实了推理作为域外泛化补充信号的有效性。
AI 推荐理由
论文核心在于利用多模态大模型的推理链能力解决域泛化问题,推理是主要机制。
研究机构
西安交通大学
微软亚洲研究院
论文信息