Code Synthesis Reinforcement Learning Multimodal LLM Scientific Visualization
摘要

图形程序合成是将静态视觉数据逆向工程为可编辑 TikZ 代码的关键技术。针对多模态大模型在空间精度上的挑战及现有数据质量与评估基准的缺失,本文提出闭环框架:构建包含 23 万高质量样本的 SciTikZ-230K 数据集与多维基准 SciTikZ-Bench;创新引入双重自一致性强化学习范式,利用往返验证机制惩罚退化代码并提升自一致性。实验表明,训练出的 SciTikZer-8B 模型在性能上超越 Gemini-2.5-Pro 等专有巨量模型。

AI 推荐理由

论文核心研究代码合成技能,通过强化学习提升工具(TikZ)生成与执行能力。

研究机构
浙江大学 上海人工智能实验室, OpenDataLab 北京大学
论文信息
作者 Juekai Lin, Yun Zhu, Honglin Lin, Sijing Li, Tianwei Lin et al.
发布日期 2026-04-07
arXiv ID 2604.06079
相关性评分 9/10 (高度相关)