Reinforcement Learning Agentic Search Grounded Reasoning Synthetic Data
摘要

本文提出 KARL 系统,利用强化学习训练企业搜索代理,在多种难以验证的任务中达到最先进水平。主要贡献包括:推出涵盖六类搜索场景的 KARLBench 评估套件;证明跨异构行为训练的模型泛化性更优;开发结合长程推理与工具使用的代理合成流水线以生成高质量训练数据;提出基于迭代大批量离线策略 RL 的新后训练范式。实验表明,KARL 在成本 - 质量与延迟 - 质量权衡上优于主流闭源模型,尤其在分布外任务中表现卓越,证实了定制合成数据与多任务强化学习对提升落地推理能力的有效性。

AI 推荐理由

论文核心在于通过强化学习提升代理在复杂搜索任务中的长程推理与 grounded reasoning 能力。

研究机构
Databricks
论文信息
作者 Jonathan D. Chang, Andrew Drozdov, Shubham Toshniwal, Owen Oertell, Alexander Trott et al.
发布日期 2026-03-05
arXiv ID 2603.05218
相关性评分 9/10 (高度相关)