摘要
针对多模态大语言模型(MLLMs)在理解时序和程序性视觉数据方面的关键缺陷,本文提出 TPRU。该研究构建了一个源自具身场景的大规模数据集,包含时序重排序、下一帧预测等三项互补任务,并引入挑战性负样本以促使模型进行跨模态验证。结合强化学习微调方法,TPRU 显著提升了资源高效型模型的时序推理能力。实验表明,TPRU-7B 在测试集上准确率从 50.33% 跃升至 75.70%,超越 GPT-4o 等更大基线,且在通用基准上表现出良好的泛化性。
AI 推荐理由
论文核心解决多模态模型在时序与程序性数据上的推理缺陷,通过专用数据集和 RL 提升推理能力。
研究机构
华东师范大学, 上海, 中国
上海人工智能实验室, 上海, 中国
论文信息