Multimodal Agent Tool Use Foundation Model Visual Perception
摘要

本文提出 GLM-5V-Turbo,旨在构建面向多模态智能体的原生基础模型。该模型将多模态感知深度整合为推理、规划、工具使用及执行的核心组件,而非语言模型的辅助接口。报告总结了其在模型设计、多模态训练、强化学习、工具链扩展及智能体框架集成方面的改进。实验表明,该模型在多模态编码、视觉工具使用及基于框架的智能体任务中表现优异,同时保持了竞争力的纯文本编码能力,为构建多模态智能体提供了关于感知核心地位与端到端验证的实践洞察。

AI 推荐理由

论文核心在于构建原生多模态智能体,重点突破视觉工具使用、代码生成及工具链扩展等技能。

研究机构
清华大学
论文信息
作者 GLM-V Team, :, Wenyi Hong, Xiaotao Gu, Ziyang Pan et al.
发布日期 2026-04-29
arXiv ID 2604.26752
相关性评分 9/10 (高度相关)