情感计算 技能蒸馏 对抗性谈判 强化学习 Agent 能力
摘要

后训练大语言模型通常被优化以符合人类偏好,但在对抗性谈判中,这种对齐可能成为漏洞。本文提出 EmoDistill,一种将情感谈判技能蒸馏至语言模型代理的离线框架。该方法将情感策略分解为情感选择与表达:利用隐式 Q 学习(IQL)决定表达何种情感,并通过低秩自适应(LoRA)结合监督微调与法官策略优化来学习如何表达。实验表明,该框架在多个高利害谈判领域显著优于基线,且无需昂贵的在线训练即可从离线交互中学习技能。

AI 推荐理由

论文核心在于通过蒸馏框架让 Agent 学习情感谈判这一特定技能,涉及策略选择与表达。

研究机构
University of Cambridge Technical University of Munich The Alan Turing Institute
论文信息
作者 Yunbo Long, Haolang Zhao, Lukas Beckenbauer, Liming Xu, Alexandra Brintrup
发布日期 2026-05-26
arXiv ID 2605.26785
相关性评分 9/10 (高度相关)