摘要
空间推理仍是多模态大语言模型的挑战。现有方法依赖静态数据集,忽视模型能力演变,导致数据效率低下。本文提出 Ouroboros-Spatial,一种自我进化训练框架。在该框架中,模型兼具提议者与求解者双重角色:冻结的提议者基于 3D 场景生成问答对及验证代码,可学习的求解者据此微调并将预测置信度作为难度信号反馈给提议者。这种闭环设计使训练分布与模型能力协同进化,过滤低价值样本。实验表明,该方法在显著减少训练数据的同时,大幅提升了模型在多个空间推理基准上的表现。
AI 推荐理由
论文提出自我进化训练框架,模型通过闭环反馈机制动态调整数据分布以适应自身能力演进。
研究机构
Peking University
Ant International
The University of Hong Kong
论文信息