Long-Horizon Tasks Training Dynamics Credit Assignment Horizon Generalization
摘要

大语言模型作为交互式智能体在解决长序列环境交互任务中展现出潜力,但任务视野长度对训练动态的影响尚不明确。本文通过构建受控任务进行系统实证研究,保持决策规则与推理结构一致,仅改变成功所需的行为序列长度。结果表明,单纯增加视野长度会导致严重的训练不稳定,源于探索困难与信用分配挑战。研究提出缩短视野是关键原则,能稳定训练并提升长程任务性能。此外,短视野训练模型在推理时能更有效泛化至长视野变体,即“视野泛化”现象。

AI 推荐理由

论文核心研究长程任务中的规划长度对训练的影响,直接关联多步计划与目标导向行为。

研究机构
Microsoft Research, Seoul, South Korea
论文信息
作者 Sunghwan Kim, Junhee Cho, Beong-woo Kwak, Taeyoon Kwon, Liang Wang et al.
发布日期 2026-05-04
arXiv ID 2605.02572
相关性评分 9/10 (高度相关)