摘要
协作式多智能体大语言模型虽能通过角色分解与假设聚合解决复杂推理任务,但共享全局奖励导致的信用分配难题常引发更新方差增大及搭便车现象。本文提出反事实信用策略优化(CCPO)框架,通过估计各智能体在反事实轨迹中的边际贡献,生成针对角色的优势信号以优化策略。此外,引入全局历史感知归一化方案,利用全局 rollout 统计校准优势值以提升稳定性。在数学与逻辑推理基准测试中,CCPO 有效抑制搭便车行为,优于现有强基线,实现了更细粒度的协作训练信用分配。
AI 推荐理由
论文核心解决多智能体协作中的推理任务,通过优化信用分配机制显著提升数学与逻辑推理性能。
研究机构
北京邮电大学
论文信息