摘要
针对多模态大语言模型在复杂视觉任务中工具执行与组合的瓶颈,本文提出 VTC-Bench 基准。该基准包含 32 种 OpenCV 视觉操作及 680 个分层问题,旨在严格评估模型的多工具组合与长程规划能力。实验显示,当前主流模型在适应多样工具集、泛化未见操作及制定高效执行计划方面存在显著局限,往往依赖次优工具子集。本研究为开发更通用的视觉代理模型确立了严谨基线。
AI 推荐理由
论文核心评估多模态 Agent 的工具使用、组合及规划执行能力,属技能学习范畴。
研究机构
清华大学
NTU
USTC
CQCU
NDUT
CASIA
Meituan
论文信息