Empathetic Dialogue Stepwise Reasoning Reinforcement Learning Strategy-aware
摘要

共情对话不仅需识别用户情绪,还需在回复生成中做出基于策略且上下文敏感的决策。针对现有方法缺乏全面共情策略框架及显式多阶段推理的问题,本文提出 STRIDE-ED 框架。该框架通过结构化、策略条件的推理建模共情对话,并构建包含 LLM 标注与动态采样的高质量数据流水线。此外,采用结合监督微调与多目标强化学习的两阶段训练范式,以对齐模型行为。实验表明,该方法在多项指标上优于现有技术。

AI 推荐理由

论文提出基于策略的逐步推理框架,核心在于多阶段认知与决策推理过程。

研究机构
Northwestern Polytechnical University Henan University of Technology
论文信息
作者 Hongru Ji, Yuyin Fan, Meng Zhao, Xianghua Li, Lianwei Wu et al.
发布日期 2026-04-08
arXiv ID 2604.07100
相关性评分 9/10 (高度相关)