摘要
针对代码生成的视觉产物常存在布局缺陷的问题,本文提出 Visual-SDPO 框架。该方法将渲染后的视觉反馈作为特权上下文,通过自蒸馏策略优化教师 - 学生模型。引入视觉接地代码信用加权机制,精准定位导致缺陷的代码语句并增强蒸馏信号。结合序列级 GRPO 项奖励高质量执行结果,同时利用执行错误辅助学习。在多个基准测试中,该方法显著提升了图表、网页及幻灯片生成的质量与成功率。
AI 推荐理由
论文提出自蒸馏框架,利用视觉反馈自我改进代码生成策略,属于典型的自我进化机制。
研究机构
Microsoft
论文信息