Reinforcement Learning Markov States Logical Reasoning Post-training
摘要

强化学习已成为大语言模型后训练的标准范式,但近期证据表明其面临持续的“能力上限”:与发现新策略的经典 RL 不同,LLM 的 RL 往往仅微调预训练权重中的潜在模式。本文指出根本瓶颈在于当前公式依赖不断扩展的动作历史,而非紧凑的马尔可夫状态。我们重新引入了显式马尔可夫状态这一经典原则,理论上证明了其能显著降低样本复杂度。实证表明,在复杂逻辑谜题中,引入该状态一致突破了标准 RL 后训练的性能边界,对解锁生成式 AI 的新推理能力至关重要。

AI 推荐理由

论文旨在突破 LLM 推理能力上限,通过引入马尔可夫状态解决逻辑谜题,核心聚焦推理。

研究机构
UW-Madison
论文信息
作者 Yurun Yuan, Tengyang Xie
发布日期 2026-03-20
arXiv ID 2603.19987
相关性评分 9/10 (高度相关)