Web Agents Efficiency Optimization Reinforcement Learning Trajectory Distillation
摘要

深度研究智能体虽具备强大信息检索能力,但常因盲目依赖工具和冗余推理导致计算成本高昂。为此,本文提出 SlimSearcher 框架,旨在平衡准确率与计算成本。在监督微调阶段,利用帕累托高效过滤蒸馏出成功且经济的轨迹;在强化学习阶段,引入自适应奖励门控机制,动态评估工具与令牌效率,避免简洁性偏差并防止奖励黑客行为。实验表明,该方法在保持或提升准确率的同时,显著减少了工具调用次数。

AI 推荐理由

论文核心在于优化 Agent 的任务执行轨迹,通过减少冗余工具调用和生成长远规划路径来提升效率。

研究机构
浙江大学 Ant Group
论文信息
作者 Zequn Xie, Junjie Wang, Dan Yang, Jie Feng, Yue Shen et al.
发布日期 2026-06-05
arXiv ID 2606.07074
相关性评分 9/10 (高度相关)