摘要
基于规则的奖励塑造是微调大语言模型的有效方法,但现有方法往往在使用后立即丢弃评估诊断信息,阻碍了评估知识的长期积累与战略复用。为此,本文提出 AMARIS 系统,将规则修改建立在长期训练历史之上。该系统通过分析单次轨迹,聚合生成步骤级摘要,并利用静态与动态检索从持久化评估记忆中获取相关历史上下文,进而更新规则。实验表明,AMARIS 在多种领域均优于基线,且异步执行仅增加约 5% 的时间开销,证明了持久化评估记忆能将无状态的启发式方法转化为证据驱动的强化学习循环。
AI 推荐理由
论文核心提出持久化评估记忆机制,通过检索历史上下文优化规则,属于记忆架构研究。
研究机构
The University of Texas at Dallas
Adobe Inc.
Department of Computer Science, University of California, Santa Barbara
论文信息