摘要
代码代理在大型仓库执行任务的前提是代码定位,即识别相关文件、类和函数。现有方法多依赖嵌入检索或复杂专用工具(如静态分析图)。本文证明,通过有效的强化学习方案,仅配备标准 Unix 终端的编码代理也能取得优异成果。在 SWE-Bench 等多个基准测试中,该模型性能超越或媲美大 2-18 倍的基础及后训练模型,甚至接近闭源模型表现。研究重点在于复用现有环境、奖励设计及 RL 优化技术,并开源了 CodeScout 模型家族及相关代码数据。
AI 推荐理由
论文核心研究利用强化学习训练 Agent 掌握代码搜索技能,仅依赖标准终端工具即可实现高效定位。
研究机构
卡内基梅隆大学
论文信息