Small Language Models Deep Research Agent Reinforcement Learning Edge Computing
摘要

本文提出 DR-Venus,一种基于 4B 参数小语言模型的边缘级深度研究代理,仅利用约 10K 开放数据训练而成。研究通过两阶段策略提升数据质量与利用率:首先采用代理监督微调建立基础能力,结合严格清洗与长程轨迹重采样;其次应用代理强化学习,基于信息增益设计轮次奖励以增强长程任务执行可靠性。实验表明,该模型在多项基准上显著优于同类小模型,并缩小了与大模型的差距,验证了小模型在边缘部署的潜力。

AI 推荐理由

论文核心在于训练小模型代理执行深度研究任务,涉及工具使用与长程轨迹优化。

研究机构
Ant Group
论文信息
作者 Venus Team, Sunhao Dai, Yong Deng, Jinzhen Lin, Yusheng Song et al.
发布日期 2026-04-21
arXiv ID 2604.19859
相关性评分 9/10 (高度相关)