摘要
针对现有搜索代理训练依赖难以扩展的金标监督问题,本文提出循环一致搜索(CCS)框架。该方法受无监督翻译启发,假设最优搜索轨迹能无损编码问题意图,从而通过重构原始问题的能力生成代理奖励。为防止信息泄露,研究引入信息瓶颈机制,如排除最终响应及命名实体掩码,确保奖励反映信息充分性而非语言冗余。实验表明,在无金标监督下,CCS 性能媲美监督基线并优于先前方法,为搜索代理提供了可扩展的训练范式。
AI 推荐理由
论文核心研究搜索代理的轨迹生成与优化,属于多步任务规划范畴。
研究机构
Meta Superintelligence Labs
UCLA
论文信息