摘要
针对现有视频编辑技术忽视物理因果性导致环境不一致的问题,本文提出 Place-it-R1 框架。该框架采用“先思考后放置”范式,利用多模态大模型的思维链推理进行场景理解与交互推导,生成环境感知令牌以指导扩散模型。通过引入空间直接偏好优化及闭环迭代 refinement 机制,实现了物理连贯的视频对象插入,并提供灵活性与保真度两种模式供用户选择。
AI 推荐理由
论文核心在于利用 MLLM 的思维链推理解决视频插入中的物理因果一致性问题。
研究机构
HKUST
Tencent Video
Peking University
论文信息