3D Scene Layout Iterative Refinement Vision-Language Models Policy Learning
摘要

本文针对单目图像构建结构化 3D 场景布局的难题,提出一种基于视觉语言模型的“先感知后规划”方法。该方法首先通过感知器定位 3D 物体,随后利用规划器通过离散动作(如平移、旋转、缩放)迭代优化场景假设,以提升物理合理性并保持与输入图像的一致性。提出的“布局即策略”(LaP)框架将规划阶段转化为策略学习问题,结合监督轨迹初始化与基于偏好的优化,无需显式奖励工程即可学习修正行为。实验表明,该方法生成的布局在物理连贯性和视觉对齐度上更优,并天然支持场景编辑等下游任务。

AI 推荐理由

论文核心提出“感知后规划”框架,将布局估计建模为基于策略的迭代规划过程。

研究机构
Dartmouth College
论文信息
作者 Junwei Zhou, Yu-Wing Tai
发布日期 2026-05-25
arXiv ID 2605.25326
相关性评分 9/10 (高度相关)