摘要
深度搜索能力已成为前沿大语言模型代理的关键技能,但其开发通常依赖工业界昂贵的全流程训练。本文证明,仅需监督微调(SFT)配合高质量、高难度的轨迹数据,即可训练出强大的搜索代理。通过扩大知识图谱规模、扩展工具集及严格过滤低步数轨迹三项改进,OpenSeeker-v2 在仅用 10.6k 数据点的情况下,于四个基准测试中超越采用复杂训练流程的通义深研等模型,成为首个由学术团队纯靠 SFT 打造的顶尖搜索代理。
AI 推荐理由
论文核心在于通过数据合成优化搜索代理的工具使用与探索技能,显著提升性能。
研究机构
Shanghai Jiao Tong University
论文信息