摘要
大型语言模型常依赖强化学习或多智能体提示提升推理,但二者难以结合。针对单智能体 RL 应用于多轮多智能体系统时的稀疏奖励、角色搭便车及训练开销大等困境,本文提出 TRACER 框架。该框架将协作决策分为控制器 - 遗憾层与生成 - 信用层:前者通过遗憾匹配学习智能体是否发言,后者利用特定角色的 GSPO 奖励优化提议与审查语句。此设计在动作模式与生成语句层面分配信用,避免搭便车并降低计算成本,同时通过二元动作设计实现数学严谨的收敛。实验表明其在 GSM8K、MATH500 等基准上具有优异的域内准确率与泛化能力。
AI 推荐理由
论文核心研究多 LLM 协作推理框架,通过强化学习解决稀疏奖励与搭便车问题,显著提升推理能力。
研究机构
复旦大学
北京大学 advanced interdisciplinary studies
中国科学院
论文信息