摘要
针对基于方面的情感分析系统缺乏显式推理能力的问题,本文提出 ABSA-R1 框架。该框架模仿人类“先推理后预测”的认知过程,利用强化学习生成自然语言理由来支撑情感预测。文章引入认知对齐奖励模型以确保推理路径与情感标签的一致性,并受元认知监控启发,实施性能驱动的拒绝采样策略以处理困难样本。实验表明,这种显式推理能力不仅提升了可解释性,还在情感分类和三元组提取任务上优于非推理基线。
AI 推荐理由
论文核心在于通过强化学习赋予模型显式推理能力,生成自然语言理由以对齐人类认知。
研究机构
School of Computer Science and Technology, East China Normal University
论文信息