摘要
本文针对大语言模型在生成 Manim 程序化动画时面临的挑战,提出了统一的训练与推理框架。训练方面,引入 ManimTrainer 流水线,结合监督微调与基于群相对策略优化的强化学习,融合代码与视觉评估信号。推理方面,设计 ManimAgent,采用渲染器闭环及文档增强策略。实验评估了 17 个开源模型,结果表明该组合策略显著提升了代码质量与视觉输出效果,最优配置在视觉相似度上超越 GPT-4.1 基线,揭示了训练与代理推理策略在文本转视频任务中的互补作用。
AI 推荐理由
核心研究 Agent 调用特定领域 API(Manim)及工具使用的训练与推理策略。
研究机构
Department of Computer Science, Nottingham Trent University, Nottingham, United Kingdom
Department of Physics and Mathematics, Nottingham Trent University, Nottingham, United Kingdom
论文信息