Prompt Optimization Multi-Agent Systems Bandit Algorithms Graph Neural Networks Self-Improvement
摘要

大型语言模型常作为多智能体系统(MAS)的认知骨干,但工作流固定且性能对提示词敏感,提示词优化成为关键。针对样本效率低、拓扑耦合及搜索空间组合爆炸三大挑战,本文提出 MASPOB 框架。该方法利用多臂老虎机平衡探索与利用,结合图神经网络捕捉结构先验以处理拓扑耦合,并通过坐标上升法将优化分解为单变量子问题,显著降低复杂度。实验表明,MASPOB 在多样基准测试中均优于现有基线,实现了状态最先进的性能。

AI 推荐理由

论文核心研究多智能体系统的提示词自动优化与自我改进机制,属于自我进化范畴。

研究机构
清华大学 中国科学院自动化研究所
论文信息
作者 Zhi Hong, Qian Zhang, Jiahang Sun, Zhiwei Shang, Mingze Kong et al.
发布日期 2026-03-03
arXiv ID 2603.02630
相关性评分 9/10 (高度相关)