摘要
针对大语言模型编码智能体在长周期软件工程中的持久化记忆需求,本文提出“强化学习开发者记忆”架构。该架构基于模型上下文协议(MCP),将记忆选择视为日志化的上下文决策过程,包含问题匹配排序、反馈映射奖励及决议记录机制。系统采用确定性排序器部署,结合影子模式下的上下文多臂老虎机策略,并通过保守的离策评估门控确保安全。实验表明,该架构在硬负样本抑制和决策准确性上表现优异,提供了一种可审计的记忆控制方案。
AI 推荐理由
论文核心提出面向 RL 编码智能体的记忆架构,解决持久化记忆与反馈归一化问题。
研究机构
PythiaLab, Yıldız Technical University, Istanbul, Türkiye
论文信息