摘要
针对现有视觉语言模型在时序动态推理上的不足,本文提出 SynRL 框架。该方法利用程序生成的合成视频,教导模型掌握方向、速度和状态跟踪等基础时序原语。研究发现,这些从简单几何图形中学到的抽象技能可有效迁移至复杂真实场景。实验表明,仅用少量合成思维链样本,SynRL 在 15 个基准测试中均优于使用大量真实数据训练的模型,确立了通过精心设计的合成数据进行视频后训练的新范式。
AI 推荐理由
论文核心在于通过合成数据训练模型掌握时序原语,显著提升视频推理能力。
研究机构
浙江大学
Owen Team, 阿里巴巴集团
上海交通大学
清华大学
论文信息