Vision-Language Agent Tool Use Pixel-Space Operations Test-Time Adaptation
摘要

大多数视觉语言系统是被动的观察者,缺乏行动与适应能力。本文提出 Pixelis,一种直接在图像和视频上操作的像素空间智能体,通过一组可执行操作(如缩放、分割、跟踪、OCR)进行学习。该方法包含三个阶段:监督微调学习像素工具语法;好奇心 - 连贯性奖励微调优化双重目标以生成结构化工具链;测试时强化学习实现无标签自适应。实验表明,Pixelis 在多个基准上显著优于基线,生成了更短且可审计的工具链,将多模态感知扎根于物理世界,实现了无需外部反馈的具身适应。

AI 推荐理由

论文核心提出基于像素空间的智能体,直接学习并执行缩放、分割等可操作工具技能。

研究机构
University of Reading, Reading, UK
论文信息
作者 Yunpeng Zhou
发布日期 2026-03-26
arXiv ID 2603.25091
相关性评分 9/10 (高度相关)