Self-Evolution Emotion Recognition Reinforcement Learning Data Flywheel
摘要

针对对话情感识别中高质量标注数据稀缺及静态限制,本文提出 SELF-EMO 自我进化框架。该框架基于“更优的情感预测导向更一致的情感响应”假设,引入情感理解与表达辅助任务,设计基于角色的自博弈范式。模型兼具识别者与回应者角色,通过迭代交互生成多样化对话轨迹以实现可扩展数据生成。此外,采用数据飞轮机制过滤样本并反馈以促进持续自我提升,同时开发 SELF-GRPO 强化学习算法稳定优化过程。实验表明该方法在多个数据集上达到最先进水平。

AI 推荐理由

论文提出自我进化框架,通过自博弈和数据飞轮机制实现无监督持续自我改进。

研究机构
SenseTime Tsinghua University
论文信息
作者 Shaowei Zhang, Faqiang Qian, Yan Chen, Ziliang Wang, Kang An et al.
发布日期 2026-04-20
arXiv ID 2604.18003
相关性评分 9/10 (高度相关)