Multimodal Agents Tool Use Benchmark Visual Reasoning
摘要

针对多模态大语言模型在复杂视觉任务中工具执行与组合的瓶颈,本文提出 VTC-Bench 基准。该基准包含 32 种 OpenCV 视觉操作及 680 个分层问题,旨在严格评估模型的多工具组合与长程规划能力。实验显示,当前主流模型在适应多样工具集、泛化未见操作及制定高效执行计划方面存在显著局限,往往依赖次优工具子集。本研究为开发更通用的视觉代理模型确立了严谨基线。

AI 推荐理由

论文核心评估多模态 Agent 的工具使用、组合及规划执行能力,属技能学习范畴。

研究机构
清华大学 NTU USTC CQCU NDUT CASIA Meituan
论文信息
作者 Xuanyu Zhu, Yuhao Dong, Rundong Wang, Yang Shi, Zhipeng Wu et al.
发布日期 2026-03-16
arXiv ID 2603.15030
相关性评分 9/10 (高度相关)