Multi-Agent Systems Prompt Optimization Continuous Improvement LLM-as-Judge
摘要

本文针对对话式购物助手从原型到生产面临的评估与优化挑战,提出了一套实用蓝图。研究构建了多维评估标准及校准的“大模型即裁判”流程。在此基础上,探索了两种提示词优化策略:针对单智能体的子节点优化,以及 novel 的系统级 MAMuT 方法,后者通过多轮模拟联合优化多智能体提示词。该工作为构建生产级多智能体系统提供了评估模板与设计指导。

AI 推荐理由

论文核心提出多智能体系统的持续优化蓝图,利用 GEPA 实现自我改进。

研究机构
WithMetics DoorDash
论文信息
作者 Alejandro Breen Herrera, Aayush Sheth, Steven G. Xu, Zhucheng Zhan, Charles Wright et al.
发布日期 2026-03-03
arXiv ID 2603.03565
相关性评分 9/10 (高度相关)