摘要
基于大语言模型的多智能体系统在复杂任务中表现优异,但其自动化配置仍面临挑战,因系统级评分难以指导局部参数更新。本文指出该问题本质为信用分配,并提出 CANTANTE 框架。该方法通过对比同一查询下多种联合配置的 rollout,将系统级奖励分解为各智能体的更新信号,应用于提示词优化。实验表明,CANTANTE 在编程、数学推理及多跳问答基准上均优于现有优化器,显著提升了系统性能并降低了推理成本。
AI 推荐理由
论文提出基于对比信用分配的框架,实现多智能体系统的自动配置与提示词自我优化。
研究机构
University of Freiburg
ELLISS Institute Tübingen
论文信息