摘要
近期大型视觉语言模型(LVLMs)推动了免训练细粒度视觉识别的发展,但受限于子类别固有的视觉模糊性,现有方法存在两大局限:一是对所有样本采用统一推理流程,忽视难度差异;二是缺乏整合并重用错误经验的机制。为此,本文提出 SARE 框架,采用级联设计结合快速检索与细粒度推理,仅在必要时触发后者。该框架引入自反思经验机制,利用过往失败案例提供可迁移的判别指导,无需参数更新即可显著提升准确率并降低计算开销。
AI 推荐理由
论文提出样本级自适应推理框架,核心在于动态推理机制与自我反思经验利用。
研究机构
浙江大学
网易有道AI实验室
论文信息