Reinforcement Learning Memory Mechanism Reward Shaping Diversity Enhancement
摘要

尽管大语言模型强化学习取得成功,但常因采样多样性降低而重复生成错误行为。经典熵正则化仅鼓励当前策略的随机性,无法显式抑制跨轮次的重复失败模式。本文提出 MEDS(记忆增强动态奖励塑形)框架,将历史行为信号融入奖励设计。通过存储和利用中间模型表示,捕捉过往轮次特征,并采用基于密度的聚类识别高频重复错误模式。对高频错误簇分配更重惩罚,从而鼓励广泛探索并减少重复犯错。实验表明,MEDS 在多个数据集和基座模型上均显著提升性能与行为多样性。

AI 推荐理由

论文提出基于记忆的奖励塑形框架,核心利用历史行为信号和聚类识别错误模式。

研究机构
Fudan University Shanghai Innovation Institute
论文信息
作者 Yang Liu, Enxi Wang, Yufei Gao, Weixin Zhang, Bo Wang et al.
发布日期 2026-04-13
arXiv ID 2604.11297
相关性评分 9/10 (高度相关)