摘要
针对 AI 系统在复杂环境中对隐式查询与图像进行整体推理以定位目标的需求,本文提出 Segment Anything Reasoner (StAR) 框架。该方法从参数微调、奖励函数及学习策略等多维度优化设计,并首次将并行测试时扩展引入分割任务。此外,构建了包含深层推理样本的 ReasonSeg-X 基准数据集。实验表明,仅需 5k 训练样本,StAR 即可显著超越基线模型,有效激活了基础模型潜在的推理能力。
AI 推荐理由
论文核心在于通过新框架和数据集激发模型潜在的视觉推理能力,解决现有方法不足。
研究机构
KAIST AI
首尔大学
论文信息