Multimodal LLM Video Editing Chain-of-Thought Physical Reasoning
摘要

针对现有视频编辑技术忽视物理因果性导致环境不一致的问题,本文提出 Place-it-R1 框架。该框架采用“先思考后放置”范式,利用多模态大模型的思维链推理进行场景理解与交互推导,生成环境感知令牌以指导扩散模型。通过引入空间直接偏好优化及闭环迭代 refinement 机制,实现了物理连贯的视频对象插入,并提供灵活性与保真度两种模式供用户选择。

AI 推荐理由

论文核心在于利用 MLLM 的思维链推理解决视频插入中的物理因果一致性问题。

研究机构
HKUST Tencent Video Peking University
论文信息
作者 Bohai Gu, Taiyi Wu, Dazhao Du, Jian Liu, Shuai Yang et al.
发布日期 2026-03-06
arXiv ID 2603.06140
相关性评分 9/10 (高度相关)