Multi-Agent Bayesian Optimization Exploration-Exploitation Task Decomposition
摘要

针对大语言模型在序列决策中探索与利用权衡机制不明确的问题,本文提出一种多智能体框架。单智能体方法因认知过载导致搜索不稳定,本方案将控制分解为战略策略调解与战术候选生成:策略智能体分配可解释的搜索权重,生成智能体据此产生候选解。该分解使决策显式化且可调。实验表明,分离战略控制与候选生成显著提升了大语言模型介导的搜索效率。

AI 推荐理由

提出多智能体框架分解策略规划与候选生成,核心解决任务规划与控制问题。

研究机构
University of Illinois Chicago, IL, USA
论文信息
作者 Andrea Carbonati, Mohammadsina Almasi, Hadis Anahideh
发布日期 2026-03-30
arXiv ID 2603.28959
相关性评分 9/10 (高度相关)