摘要
针对现有电商购物智能体缺乏交互深度与上下文广度的问题,本文提出 ProductResearch 框架。该框架利用用户智能体推断意图,并通过监督智能体协调研究智能体,生成高保真、长程的工具使用合成轨迹。经反思内化过程蒸馏后,这些数据用于微调 LLM 智能体。实验表明,基于此数据微调的紧凑 MoE 模型在回复全面性、研究深度及用户效用上显著提升,接近前沿专有系统性能,确立了多智能体合成轨迹训练的有效范式。
AI 推荐理由
论文核心在于通过多智能体合成轨迹训练 Agent 的长程工具使用能力,属于技能学习范畴。
研究机构
阿里巴巴国际数字商业集团
论文信息