Reinforcement Learning Code Search Coding Agents Tool Use
摘要

代码代理在大型仓库执行任务的前提是代码定位,即识别相关文件、类和函数。现有方法多依赖嵌入检索或复杂专用工具(如静态分析图)。本文证明,通过有效的强化学习方案,仅配备标准 Unix 终端的编码代理也能取得优异成果。在 SWE-Bench 等多个基准测试中,该模型性能超越或媲美大 2-18 倍的基础及后训练模型,甚至接近闭源模型表现。研究重点在于复用现有环境、奖励设计及 RL 优化技术,并开源了 CodeScout 模型家族及相关代码数据。

AI 推荐理由

论文核心研究利用强化学习训练 Agent 掌握代码搜索技能,仅依赖标准终端工具即可实现高效定位。

研究机构
卡内基梅隆大学
论文信息
作者 Lintang Sutawika, Aditya Bharat Soni, Bharath Sriraam R R, Apurva Gandhi, Taha Yassine et al.
发布日期 2026-03-18
arXiv ID 2603.17829
相关性评分 9/10 (高度相关)