摘要
近期多模态大语言模型实现了从自然语言描述自动生成结构化布局。现有方法通常仅生成代码并由图形引擎渲染,缺乏对最终视觉效果的感知,难以保证可读性与美观度。本文提出视觉反馈布局模型(VFLM),一种利用视觉反馈进行迭代优化的自改进框架。该模型具备自适应反思生成能力,通过结合 OCR 准确率的视觉奖励模型进行强化学习,仅奖励最终生成结果以激发模型的迭代反思能力。实验表明,VFLM 在多个基准测试中优于现有先进模型。
AI 推荐理由
论文提出自改进框架,利用视觉反馈进行迭代反思与生成优化,核心机制属于自我进化。
研究机构
中国科学技术大学
论文信息