Multimodal LLM Reinforcement Learning Visual Reasoning Smart Agriculture
摘要

针对害虫识别中物种复杂度高及专家数据稀缺的挑战,本文提出 Pest-Thinker,一种知识驱动的强化学习框架,旨在赋能多模态大模型进行细粒度害虫形态推理。研究构建了包含专家标注形态特征的高质量基准数据集,利用思维链轨迹通过监督微调实现结构化学习。随后,采用组相对策略优化算法,结合新颖的特征奖励机制与“大模型即裁判”策略,引导模型关注可观察的形态证据。实验表明,该方法显著提升了域内及域外的形态理解能力,推动了智能农业害虫分析向专家级视觉推理迈进。

AI 推荐理由

论文核心是通过强化学习让 MLLM 学习专家级的细粒度形态推理能力,明确聚焦推理机制。

研究机构
中国科学院大学
论文信息
作者 Xueheng Li, Yu Wang, Tao Hu, Ji Huang, Ke Cao et al.
发布日期 2026-05-07
arXiv ID 2605.06121
相关性评分 9/10 (高度相关)