摘要
针对多模态几何推理中视觉图表理解与结构化符号推断联合处理的挑战,本文提出了一种从头合成复杂问题的流程,构建了 GeoCode 数据集。该数据集将问题生成分解为符号种子构建、基于验证的实例化及代码渲染,确保结构、文本与图像的一致性。利用绘图代码,本文引入代码预测作为显式对齐目标,将视觉理解转化为监督结构化预测任务。实验表明,在 GeoCode 上训练的模型在多个几何基准测试中表现显著提升,验证了数据集及对齐策略的有效性。
AI 推荐理由
论文核心解决多模态几何推理难题,通过数据合成与代码对齐提升结构化符号推断能力。
研究机构
USTC
PKU
论文信息