摘要
语言模型能否系统性泛化仍存争议。本文引入基于最短路径规划的受控合成环境,该问题是典型的组合序列优化问题。实验设置分离了训练数据、范式及推理策略等因素,支持空间迁移与长度扩展两个正交泛化维度。研究发现,模型虽具备强空间迁移能力,但因递归不稳定性而在长度扩展上持续失败。分析表明,数据覆盖设定了能力上限,强化学习提升了稳定性但未突破上限,推理时扩展虽增强性能却无法挽救长度扩展的失败。
AI 推荐理由
论文基于最短路径规划任务,核心研究 LLM 在长程规划中的长度扩展失败问题。
研究机构
National University of Singapore
Capital Fund Management
Google Research
论文信息