自我进化 强化学习 创意写作 多智能体协作 自我反思
摘要

针对创意写作缺乏可验证参考答案导致奖励建模困难的问题,本文设计了基于扎根理论的多智能体协作流程,动态生成可解释的细粒度评估标准。进而提出记忆增强回放策略优化(MRPO)算法:一方面引导模型基于动态标准进行自我反思以实现可控迭代改进;另一方面结合监督微调与强化学习,将评估标准转化为奖励信号实现端到端优化。实验表明,该方法在多个任务上优于基线及部分千亿参数开源模型。

AI 推荐理由

论文提出 MRPO 算法,通过自我反思和动态标准实现模型的迭代改进与端到端优化,核心聚焦自我进化。

研究机构
中国人民大学信息学院,中国北京 中国人民大学信息学院,Brain实验室,中国北京
论文信息
作者 Jihao Zhao, Shuaishuai Zu, Zhiyuan Ji, Chunlai Zhou, Biao Qin
发布日期 2026-03-16
arXiv ID 2603.15061
相关性评分 9/10 (高度相关)