Multimodal LLM Geometric Reasoning Code Generation Visual Perception
摘要

多模态大语言模型虽具强大感知与推理力,但在细粒度几何结构感知上存在局限。为此,本文提出 GeoTikzBridge 框架,通过基于 TikZ 的代码生成增强局部几何感知与视觉推理。该框架包含两个模型:GeoTikzBridge-Base 基于最大的图像转 TikZ 数据集训练;GeoTikzBridge-Instruct 则在首个支持视觉推理的指令增强数据集上微调。实验表明,该模型在开源多模态大模型中达到最先进水平,并可作为即插即用模块提升任意模型的几何解题推理性能。

AI 推荐理由

论文核心在于通过代码生成增强多模态模型的几何感知与视觉推理能力,直接解决推理短板。

研究机构
聚力科技研究
论文信息
作者 Jiayin Sun, Caixia Sun, Boyu Yang, Hailin Li, Xiao Chen et al.
发布日期 2026-03-24
arXiv ID 2603.22687
相关性评分 9/10 (高度相关)