Subagents Model Finetuning Terminal Execution Code Agents Efficiency
摘要

现代编码代理常将搜索、调试或终端执行等专用子任务委托给子代理,以隔离冗长输出并保持主代理上下文清洁。本文探究经微调的小型语言模型(SLM)是否能在代理终端执行任务中达到与前沿模型相当的性能。我们提出了 Terminus-4B,这是一个基于 Qwen3-4B,通过监督微调和基于规则的强化学习进行后训练的模型。评估显示,相比无子代理基线,Terminus-4B 能将主代理的 token 用量减少约 30%,且在 SWE-Bench Pro 等基准上性能无损,甚至在某些指标上超越前沿模型。

AI 推荐理由

论文核心研究小型模型在终端执行等特定代理技能上的表现,通过微调实现工具使用能力的提升。

研究机构
Microsoft USA
论文信息
作者 Spandan Garg, Vikram Nitin, Yufan Huang
发布日期 2026-05-04
arXiv ID 2605.03195
相关性评分 9/10 (高度相关)