摘要
尽管大语言模型强化学习取得成功,但常因采样多样性降低而重复生成错误行为。经典熵正则化仅鼓励当前策略的随机性,无法显式抑制跨轮次的重复失败模式。本文提出 MEDS(记忆增强动态奖励塑形)框架,将历史行为信号融入奖励设计。通过存储和利用中间模型表示,捕捉过往轮次特征,并采用基于密度的聚类识别高频重复错误模式。对高频错误簇分配更重惩罚,从而鼓励广泛探索并减少重复犯错。实验表明,MEDS 在多个数据集和基座模型上均显著提升性能与行为多样性。
AI 推荐理由
论文提出基于记忆的奖励塑形框架,核心利用历史行为信号和聚类识别错误模式。
研究机构
Fudan University
Shanghai Innovation Institute
论文信息