Code Generation Reinforcement Learning Agentic Inference Manim Text-to-Video
摘要

本文针对大语言模型在生成 Manim 程序化动画时面临的挑战,提出了统一的训练与推理框架。训练方面,引入 ManimTrainer 流水线,结合监督微调与基于群相对策略优化的强化学习,融合代码与视觉评估信号。推理方面,设计 ManimAgent,采用渲染器闭环及文档增强策略。实验评估了 17 个开源模型,结果表明该组合策略显著提升了代码质量与视觉输出效果,最优配置在视觉相似度上超越 GPT-4.1 基线,揭示了训练与代理推理策略在文本转视频任务中的互补作用。

AI 推荐理由

核心研究 Agent 调用特定领域 API(Manim)及工具使用的训练与推理策略。

研究机构
Department of Computer Science, Nottingham Trent University, Nottingham, United Kingdom Department of Physics and Mathematics, Nottingham Trent University, Nottingham, United Kingdom
论文信息
作者 Ravidu Suien Rammuni Silva, Ahmad Lotfi, Isibor Kennedy Ihianle, Golnaz Shahtahmassebi, Jordan J. Bird
发布日期 2026-04-20
arXiv ID 2604.18364
相关性评分 9/10 (高度相关)