摘要
多模态讽刺检测需要通过跨模态推理解决文本、声学和视觉线索间的语用不一致。为使基础模型具备鲁棒的讽刺推理能力,本文提出 SarcasmMiner,一种基于强化学习的后训练框架,旨在抵抗多模态推理中的幻觉。该方法将讽刺检测重构为结构化推理,采用双轨蒸馏策略:利用高质量教师轨迹初始化学生模型,同时使用全量轨迹训练生成式奖励模型以评估推理质量。学生模型通过群相对策略优化(GRPO)进行优化,采用解耦的准确性与推理质量奖励。在 MUStARD++ 数据集上,F1 分数从零射的 59.83% 和监督微调的 68.23% 提升至 70.22%。结果表明,感知推理的奖励建模增强了性能及多模态 grounding 能力。
AI 推荐理由
论文核心在于通过强化学习框架解决多模态讽刺检测中的跨模态推理问题,显著提升推理鲁棒性。
研究机构
格罗宁根大学语言与认知中心,荷兰
论文信息