Emotional Reasoning Reinforcement Learning Multimodal LLM Interpretability
摘要

多模态大语言模型在视觉推理任务中表现优异,但在捕捉人类情感的复杂性与主观性方面仍显不足。现有监督微调方法泛化性有限且可解释性差,而传统强化学习难以契合情感认知特征。为此,本文提出 EMO-R3 框架,通过引入“结构化情感思维”引导模型进行可解释的分步推理,并设计“反思性情感奖励”机制,基于图文一致性与情感连贯性对推理过程进行重评估。实验表明,该方法显著提升了模型的情感智能与可解释性,在多个基准测试中取得优越性能。

AI 推荐理由

论文核心提出结构化情感思维机制,旨在增强多模态模型的分步推理与逻辑解释能力。

研究机构
武汉大学计算机学院 小米集团
论文信息
作者 Yiyang Fang, Wenke Huang, Pei Fu, Yihao Yang, Kehua Su et al.
发布日期 2026-02-27
arXiv ID 2602.23802
相关性评分 9/10 (高度相关)