RLHF Memory Mechanism Reward Modeling Adaptive Learning
摘要

为开放生成任务设计对齐且鲁棒的奖励仍是强化学习后训练的关键障碍。规则虽提供结构化监督,但构建困难。本文提出 SibylSense,一种推理时学习方法,通过可调的记忆库存储已验证的规则项来适应冻结的规则生成器。记忆基于验证者测量的判别差距进行更新,并交替进行记忆调优与对抗策略更新,以缩小差距并驱动生成器捕捉新质量维度。实验表明该方法优于静态基线。

AI 推荐理由

论文核心提出基于可调记忆库的自适应规则学习机制,记忆更新与调优是方法关键。

研究机构
Microsoft University of California, Los Angeles
论文信息
作者 Yifei Xu, Guilherme Potje, Shivam Shandilya, Tiancheng Yuan, Leonardo de Oliveira Nunes et al.
发布日期 2026-02-24
arXiv ID 2602.20751
相关性评分 9/10 (高度相关)