摘要
本文研究了多模态大语言模型如何有效掌握工具使用以解决复杂视觉推理任务的问题。为此,我们提出了一种新颖的工具监督强化学习(ToolsRL)框架,通过直接的工具监督来提升工具学习效率。该研究聚焦于一系列简单、原生且可解释的视觉工具(如缩放、旋转、翻转及绘制点线),其监督信号易于获取。我们开发了一种强化学习课程:第一阶段仅利用精心设计的工具特定奖励进行优化;第二阶段则在允许调用工具的同时,采用针对准确性的奖励进行训练。这种分阶段策略确保模型在使用工具完成推理任务前先掌握调用能力,避免了异构任务间的优化冲突。实验表明,该课程训练高效,使模型在复杂视觉推理中展现出强大的工具使用能力。
AI 推荐理由
论文核心提出工具监督强化学习框架,专注于多模态模型掌握视觉工具使用技能以解决推理任务。
研究机构
东北大学
Amazon AGI
论文信息