摘要
传统视觉语言模型在对比性细粒度分类推理中表现不佳,难以区分同属或同科内视觉相似的物种。本文提出 TaxonRL,一种基于群相对策略优化并引入中间奖励的强化学习方法,将推理过程分解为层级化的分类预测。该方法激励模型在最终分类前,显式地对物种、属和科级别的特征进行推理。这种结构化方法不仅提升了准确率,还生成了透明且可验证的决策过程。在 Birds-to-Words 数据集上,TaxonRL 平均准确率达 91.7%,超越人类表现,并展现出强大的跨领域泛化能力。
AI 推荐理由
论文核心提出分层推理机制,通过中间奖励显式引导模型进行细粒度视觉推理。
研究机构
波茨坦大学
论文信息