摘要
近期提示学习进展使大语言模型代理能在推理时获取任务知识而无需参数更新。然而,现有方法多局限于单代理或低并行场景,难以高效利用大量代理轨迹数据。为此,本文提出 Combee,一种用于扩展并行提示学习以实现代理自我改进的新框架。Combee 利用并行扫描和增强洗牌机制,并引入动态批次大小控制器以平衡质量与延迟。实验表明,该方法在保持或提升准确率的同时,较以往方法实现了高达 17 倍的加速。
AI 推荐理由
论文核心提出 Combee 框架,旨在通过大规模并行提示学习实现 Agent 的自我改进与进化。
研究机构
UC Berkeley
Stanford University
Tensormesh
Gradient Network
论文信息