摘要
优化工业销售大语言模型需平衡长期商业目标(如转化率)与即时语言约束(如流畅度)。传统强化学习常将异质目标合并为单一奖励,导致会话级高幅值奖励淹没轮次级细微信号,引发训练不稳定或奖励黑客。为此,本文提出双视界信用分配(DuCA)框架,解耦不同时间尺度的优化。其核心是视界独立优势归一化(HIAN),在融合前分别归一化轮次级与会话级奖励的优势,确保即时与长期目标对策略更新的梯度贡献平衡。实验表明,DuCA 显著提升了转化率并减少了重复与身份检测率。
AI 推荐理由
论文提出 DuCA 框架,通过强化学习优化 Agent 策略,平衡长短期目标,属于自我改进与自适应进化。
研究机构
北京大学
北京邮电大学
Sun Yat-sen University
University of California at Merced
Meituan
论文信息