摘要
搜索代理通常需在不断增长的记录中同时决策搜索与管理状态,导致策略负担过重。本文提出 Harness-1,一种基于强化学习的 20B 搜索代理,其创新在于引入有状态的“ harness
AI 推荐理由
论文核心提出状态外化架构,将记忆管理从策略中剥离至环境侧,显著优化 Agent 记忆机制。
研究机构
University of Illinois at Urbana-Champaign
UC Berkeley
Chroma
论文信息