摘要
针对多模态深度搜索中视觉证据无法复用及训练数据静态化的瓶颈,本文提出视觉原生 Agent 架构与在线策略数据进化(ODE)方法。该架构通过图像库协议使中间视觉证据可被后续工具调用;ODE 则构建闭环数据生成器,基于当前策略的 rollout 反馈动态优化训练数据,覆盖监督微调与强化学习全周期。实验表明,该方法显著提升了多模态 Agent 在复杂任务中的表现,优于现有主流模型。
AI 推荐理由
论文核心提出 On-policy Data Evolution (ODE) 框架,通过闭环数据生成实现 Agent 能力的自我迭代与进化。
研究机构
香港理工大学
论文信息