Reinforcement Learning Self-Correction Chart-to-Code Multimodal LLM Agent Evolution
摘要

多模态大语言模型在图表转代码任务中表现优异,但现有方法多依赖监督微调,缺乏代码执行环境交互,且自我修正能力不足。本文提出 MM-ReCoder,一种结合强化学习与自我修正能力的图表转代码模型。该方法采用基于组相对策略优化的两阶段多轮自我修正策略:第一阶段通过共享首轮 rollout 增强自我修正能力,第二阶段通过全轨迹优化提升编码能力。模型通过与环境交互及迭代修正输出,生成更准确可执行的代码。在三个基准测试中,MM-ReCoder 均取得了最先进性能。

AI 推荐理由

论文核心在于利用强化学习和自我修正机制,使模型在交互中迭代优化代码生成能力,属于典型的自我进化研究。

研究机构
Brown University Amazon AGI
论文信息
作者 Zitian Tang, Xu Zhang, Jianbo Yuan, Yang Zou, Varad Gunjal et al.
发布日期 2026-04-02
arXiv ID 2604.01600
相关性评分 9/10 (高度相关)