Vision-Language Models Spatial Planning Benchmark Multimodal Reasoning
摘要

针对国土治理中空间规划地图解读所需的细粒度视觉感知与专业判断挑战,本文推出 PlanBench-V,首个评估视觉语言模型(VLM)在此领域表现的综合基准。构建了包含 223 张专家标注地图的数据集,并提出涵盖感知、推理、关联与实施四阶段的能力评估框架。实验表明,虽最新模型性能显著提升,但在需政策敏感性与约束决策的实施类任务上仍存在根本局限,亟需领域自适应的多模态推理框架。

AI 推荐理由

论文提出空间规划地图基准,核心评估 VLM 在规划任务中的感知、推理及实施能力。

研究机构
行为与空间智能实验室,同济大学 行为与空间AI实验室,北京大学 建筑与城市规划学院,同济大学
论文信息
作者 Minxin Chen, He Zhu, Junyou Su, Wen Wang, Yijie Deng et al.
发布日期 2026-06-04
arXiv ID 2606.05744
相关性评分 9/10 (高度相关)