摘要
近期深度研究代理主要通过扩展推理深度提升性能,但这导致高推理成本与延迟,且难以在不同研究场景中泛化。本文提出“多搜少想”(SMTL)框架,旨在兼顾长程智能体搜索的效率与泛化能力。SMTL 以并行证据获取取代顺序推理,在受限上下文预算下实现高效管理。此外,引入统一数据合成流水线,构建涵盖确定性问答与开放式研究场景的任务,以支持跨任务类型泛化。通过监督微调与强化学习训练端到端代理,在多个基准测试中取得优异性能,显著减少推理步数并提升准确率。
AI 推荐理由
论文核心提出长程搜索框架,通过并行证据获取替代顺序推理,优化任务规划效率与泛化。
研究机构
OPPO
论文信息