摘要
多智能体系统虽能处理复杂任务,但面临协调开销大等挑战。将多智能体蒸馏为单智能体技能可规避这些问题,但其效果往往不一致。本文揭示技能效用取决于评估指标而非任务本身,并提出“度量自由度”作为预测器。基于此,作者设计了两阶段自适应蒸馏框架:第一阶段选择性提取工具与知识以保留探索性;第二阶段针对刚性指标进行迭代优化。实验表明,该方法在显著降低成本和延迟的同时,性能匹配或超越原多智能体系统。
AI 推荐理由
论文核心研究多智能体技能蒸馏为单智能体技能的机制、条件及优化框架。
研究机构
The Chinese University of Hong Kong, Hong Kong, China
LIGHTSPEED, Shenzhen, China
论文信息