Remote Sensing Visual Grounding Multi-Entity Reasoning Reinforcement Learning Benchmark
摘要

近期推理语言模型与可验证奖励强化学习的进展显著提升了多步推理能力,促使研究者将推理范式扩展至遥感视觉定位任务。然而,现有方法多局限于感知级匹配与单实体设定,缺乏显式推理与实体间建模。为此,本文提出了遥感多实体推理定位(ME-RSRG)新基准数据集,并将该任务重构为多实体推理问题。作者提出了基于视觉 - 语言基础模型的实体感知推理(EAR)框架,生成结构化推理轨迹及主客体定位输出。该框架采用监督微调进行冷启动初始化,并通过实体感知的奖励驱动群相对策略优化(GRPO)进一步优化。实验验证了 EAR 框架的有效性。

AI 推荐理由

论文核心聚焦多实体推理,提出推理框架并构建基准,深度研究推理机制。

研究机构
北京大学,北京,中国 利物浦大学,利物浦,英国 中国科学院声学研究所,北京,中国
论文信息
作者 Shuchang Lyu, Haiquan Wen, Guangliang Cheng, Meng Li, Zheng Zhou et al.
发布日期 2026-03-13
arXiv ID 2603.12788
相关性评分 9/10 (高度相关)