摘要
针对现有大模型代理在自动化数据科学中受限于静态动作集及缺乏长程上下文管理的问题,本文提出 EvoDS。这是一种自我进化的自主代理,利用代理强化学习扩展技能并自适应管理长期上下文。其核心策略包括:自主技能获取机制,支持合成、验证及复用可执行技能;自适应上下文压缩策略,将上下文管理视为学习型控制问题。理论证明该设计降低了工具选择错误,实证显示其在多个基准测试中平均性能提升 28.9%,且消除了令牌溢出失败。
AI 推荐理由
论文核心提出自我进化代理,通过强化学习实现技能自主获取与自适应上下文管理。
研究机构
The Hong Kong University of Science and Technology (Guangzhou)
论文信息