摘要
针对创意写作缺乏可验证参考答案导致奖励建模困难的问题,本文设计了基于扎根理论的多智能体协作流程,动态生成可解释的细粒度评估标准。进而提出记忆增强回放策略优化(MRPO)算法:一方面引导模型基于动态标准进行自我反思以实现可控迭代改进;另一方面结合监督微调与强化学习,将评估标准转化为奖励信号实现端到端优化。实验表明,该方法在多个任务上优于基线及部分千亿参数开源模型。
AI 推荐理由
论文提出 MRPO 算法,通过自我反思和动态标准实现模型的迭代改进与端到端优化,核心聚焦自我进化。
研究机构
中国人民大学信息学院,中国北京
中国人民大学信息学院,Brain实验室,中国北京
论文信息