Agentic Search Visual Perception Open-world Recognition Multimodal Agent
摘要

视觉感知连接高层语义理解与像素级感知,但现有研究多假设关键证据已存在于图像或模型知识中。本文研究更具挑战性的开放世界场景,即目标需先通过外部事实、近期事件或长尾实体解析后方可定位。为此,我们形式化了“深度感知研究”挑战,推出 WebEye 基准,包含基于搜索的定位、分割及问答任务。同时提出 Pixel-Searcher,一种代理式“搜索至像素”工作流,用于解析隐藏目标身份并将其绑定至边界框、掩码或答案。实验表明该方法在各项任务中表现最优。

AI 推荐理由

论文提出代理式搜索工作流,涉及多步规划以解决开放世界视觉感知中的目标识别与定位问题。

研究机构
深圳大学 中国科学院自动化研究所
论文信息
作者 Bokang Yang, Xinyi Sun, Kaituo Feng, Xingping Dong, Dongming Wu et al.
发布日期 2026-05-12
arXiv ID 2605.12497
相关性评分 8/10 (高度相关)