摘要
强化学习是将大语言模型演化为具备长程规划能力的自主智能体的关键,但在复杂多轮环境中扩展强化学习仍缺乏实用方案。本文利用需要工具编排以满足多方面约束的挑战性测试床 TravelPlanner,进行了系统的实证研究。我们将智能体强化学习的设计空间分解为奖励塑造、模型缩放、数据构成、算法选择和环境稳定性五个维度。实验得出七项关键结论,包括奖励与算法选择依赖于模型规模,以及环境稳定性对防止策略退化至关重要。基于此方案,我们的模型在 TravelPlanner 上取得了最先进性能。
AI 推荐理由
论文核心研究长程规划中的强化学习机制,通过工具编排解决多约束任务。
研究机构
香港中文大学
澳门大学
IDEA研究院
论文信息