摘要
本文针对对话式购物助手从原型到生产面临的评估与优化挑战,提出了一套实用蓝图。研究构建了多维评估标准及校准的“大模型即裁判”流程。在此基础上,探索了两种提示词优化策略:针对单智能体的子节点优化,以及 novel 的系统级 MAMuT 方法,后者通过多轮模拟联合优化多智能体提示词。该工作为构建生产级多智能体系统提供了评估模板与设计指导。
AI 推荐理由
论文核心提出多智能体系统的持续优化蓝图,利用 GEPA 实现自我改进。
研究机构
WithMetics
DoorDash
论文信息