Agent Training Open-Source Framework Skill Learning Reinforcement Learning
摘要

本文提出 Orchard,一个旨在解决开源代理训练基础设施缺失的可扩展建模框架。其核心是轻量级环境服务 Orchard Env,支持跨领域沙箱管理。基于此,作者开发了三种代理训练方案:Orchard-SWE 通过蒸馏与强化学习提升编码能力;Orchard-GUI 利用少量数据训练视觉语言代理以执行计算机操作;Orchard-Claw 针对个人助理任务。实验表明,该框架在多个基准测试中实现了开源模型的最先进水平,证明了轻量化环境层对复用代理数据与训练策略的有效性。

AI 推荐理由

论文核心在于构建代理训练框架,重点研究代码、GUI 操作等技能的学习与优化。

研究机构
Columbia University
论文信息
作者 Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Xiao Yu et al.
发布日期 2026-05-14
arXiv ID 2605.15040
相关性评分 9/10 (高度相关)