摘要
针对大语言模型上下文窗口有限难以处理长程复杂任务的问题,本文提出一种基于委托智能的范式。主代理将任务分解并分发给子代理执行,仅接收摘要结果以节省上下文。为解决该能力训练数据稀缺问题,我们设计了引导框架,生成高质量的任务分解与委托轨迹作为监督微调数据,将委托智能内化至模型权重。 resulting 模型 SearchSwarm-30B-A3B 在 BrowseComp 基准测试中取得同类规模最佳成绩。
AI 推荐理由
论文核心研究长程任务中的任务分解、子任务分发及结果整合,属于典型的规划能力研究。
研究机构
清华大学
北京大学
论文信息