摘要
本文提出递归代理优化(RAO),一种用于训练递归代理的强化学习方法。此类代理能递归地生成自身新实例并委派子任务。递归代理实现了一种推理时扩展算法,通过分治策略自然支持更长上下文及更复杂问题的泛化。RAO 教导代理何时及如何有效委派与沟通。研究表明,该方法提升了训练效率,使代理能处理超出上下文窗口的任务,泛化至更难问题,并相比单代理系统显著减少实际运行时间。
AI 推荐理由
论文核心研究递归代理的任务分解与子任务委派机制,属于规划能力的范畴。
研究机构
Carnegie Mellon University
Amazon AGI Labs
论文信息