多模态推理 强化学习 仇恨模因检测 思维链 GRPO
摘要

仇恨模因通常需要组合式多模态推理:图像与文本单独看可能无害,但交互后传达有害意图。尽管基于思维的多模态大语言模型(MLLMs)在视觉 - 语言理解上取得进展,但其在仇恨模因分析中的能力尚待探索。本文提出一种基于强化学习的后训练框架,利用任务特定奖励和新型群组相对策略优化(GRPO)目标,提升思维型 MLLM 的推理能力。具体包括:系统评估现成 MLLM 的表现;通过蒸馏生成弱监督思维链理由以扩展数据集;引入 GRPO 目标联合优化分类与解释质量,鼓励细粒度逐步推理。实验表明该方法在 Hateful Memes 基准上达到最先进水平。

AI 推荐理由

论文核心在于通过强化学习提升多模态模型的组合推理能力,专门解决仇恨模因检测中的细粒度推理问题。

研究机构
卡塔尔大学 卡塔尔计算研究 institute APAVLAI Blackbird.AI 美国
论文信息
作者 Mohamed Bayan Kmainasi, Mucahid Kutlu, Ali Ezzat Shahroor, Abul Hasnat, Firoj Alam
发布日期 2026-03-01
arXiv ID 2603.01225
相关性评分 9/10 (高度相关)