摘要
代理检索增强生成(RAG)系统虽能解决复杂任务,但多步交互常导致冗余搜索及高昂成本。现有方法限制搜索深度易造成探索不足。本文提出 AutoSearch,一种基于强化学习的框架,通过自生成中间答案评估每一步搜索,识别最小充分搜索深度。该机制在奖励达到高效深度的同时惩罚过度搜索,并引入额外奖励以稳定行为及提升复杂问题回答质量。实验表明,AutoSearch 在保持搜索质量的同时显著优化了准确率与效率的权衡。
AI 推荐理由
论文核心在于通过 RL 动态规划搜索深度,优化多步交互效率,属于典型的任务规划研究。
研究机构
SKL-MAIS, Institute of Automation, Chinese Academy of Sciences
School of Artificial Intelligence, University of Chinese Academy of Sciences
School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences
论文信息