摘要
世界模型与多模态大语言模型在基于静态视觉观测预测未来方面具有互补性。前者生成具体的视觉推演,后者进行抽象推理。针对生成推演的随机性与任务不匹配问题,本文提出“受控具体推理”框架,使模型学会调用、验证并整合视觉模拟与抽象推理。为此构建了 VRQABench 和 OpenWorldQA 两个基准,并提出特权未来在线策略自蒸馏方法。实验表明,该方法在两个基准上显著优于基线,并增强了对噪声推演的鲁棒性。
AI 推荐理由
论文核心研究具体与抽象推理的互补机制,提出受控具体推理新范式。
研究机构
University of Macau
LIGHTSPEED
Independent Researcher
论文信息