摘要
针对对话情感识别中高质量标注数据稀缺及静态限制,本文提出 SELF-EMO 自我进化框架。该框架基于“更优的情感预测导向更一致的情感响应”假设,引入情感理解与表达辅助任务,设计基于角色的自博弈范式。模型兼具识别者与回应者角色,通过迭代交互生成多样化对话轨迹以实现可扩展数据生成。此外,采用数据飞轮机制过滤样本并反馈以促进持续自我提升,同时开发 SELF-GRPO 强化学习算法稳定优化过程。实验表明该方法在多个数据集上达到最先进水平。
AI 推荐理由
论文提出自我进化框架,通过自博弈和数据飞轮机制实现无监督持续自我改进。
研究机构
SenseTime
Tsinghua University
论文信息