Reinforcement Learning Credit Assignment Sales Agent LLM Optimization
摘要

优化工业销售大语言模型需平衡长期商业目标(如转化率)与即时语言约束(如流畅度)。传统强化学习常将异质目标合并为单一奖励,导致会话级高幅值奖励淹没轮次级细微信号,引发训练不稳定或奖励黑客。为此,本文提出双视界信用分配(DuCA)框架,解耦不同时间尺度的优化。其核心是视界独立优势归一化(HIAN),在融合前分别归一化轮次级与会话级奖励的优势,确保即时与长期目标对策略更新的梯度贡献平衡。实验表明,DuCA 显著提升了转化率并减少了重复与身份检测率。

AI 推荐理由

论文提出 DuCA 框架,通过强化学习优化 Agent 策略,平衡长短期目标,属于自我改进与自适应进化。

研究机构
北京大学 北京邮电大学 Sun Yat-sen University University of California at Merced Meituan
论文信息
作者 Haojin Yang, Ai Jian, Xinyue Huang, Yiwei Wang, Weipeng Zhang et al.
发布日期 2026-03-02
arXiv ID 2603.01481
相关性评分 9/10 (高度相关)