Mutual Reinforcement Learning Heterogeneous LLMs Experience Sharing Self-Improvement
摘要

本文提出互强化学习框架,支持异构大语言模型在保持参数、目标及分词器独立的前提下进行并发强化学习后训练。该框架包含共享经验交换、多工作资源分配及分词器异构层,实现了跨模型族的经验共享。基于 GRPO 实例化了三种探测机制:数据级滚动共享、价值级优势共享及结果级成功转移。分析表明,结果级共享在稳定性与支持度权衡中表现最优,有效促进了模型的自适应与协同进化。

AI 推荐理由

论文提出互强化学习框架,通过异质模型间经验共享实现策略协同优化与自我改进,属核心进化机制。

研究机构
Purdue University AWS Agentic AI
论文信息
作者 Xiaoze Liu, Dhananjay Ram, Yuting Zhang, Zhaoyang Zhang, Wei Xia et al.
发布日期 2026-05-08
arXiv ID 2605.07244
相关性评分 9/10 (高度相关)