摘要
本文提出互强化学习框架,支持异构大语言模型在保持参数、目标及分词器独立的前提下进行并发强化学习后训练。该框架包含共享经验交换、多工作资源分配及分词器异构层,实现了跨模型族的经验共享。基于 GRPO 实例化了三种探测机制:数据级滚动共享、价值级优势共享及结果级成功转移。分析表明,结果级共享在稳定性与支持度权衡中表现最优,有效促进了模型的自适应与协同进化。
AI 推荐理由
论文提出互强化学习框架,通过异质模型间经验共享实现策略协同优化与自我改进,属核心进化机制。
研究机构
Purdue University
AWS Agentic AI
论文信息