Credit Assignment Prompt Optimization Multi-Agent Systems Self-Improvement
摘要

基于大语言模型的多智能体系统在复杂任务中表现优异,但其自动化配置仍面临挑战,因系统级评分难以指导局部参数更新。本文指出该问题本质为信用分配,并提出 CANTANTE 框架。该方法通过对比同一查询下多种联合配置的 rollout,将系统级奖励分解为各智能体的更新信号,应用于提示词优化。实验表明,CANTANTE 在编程、数学推理及多跳问答基准上均优于现有优化器,显著提升了系统性能并降低了推理成本。

AI 推荐理由

论文提出基于对比信用分配的框架,实现多智能体系统的自动配置与提示词自我优化。

研究机构
University of Freiburg ELLISS Institute Tübingen
论文信息
作者 Tom Zehle
发布日期 2026-05-13
arXiv ID 2605.13295
相关性评分 9/10 (高度相关)