Data Selection Chain-of-Thought Bias Mitigation LLM Reasoning
摘要

大型推理模型通过在大规模高质量数据集上进行监督微调,在复杂长链思维推理任务中表现优异。现有流程通常利用更强的大语言模型生成长推理数据,并采用启发式或基于自然度的方法筛选高质量样本。然而,本文分析发现,基于自然度的数据选择在应用于推理数据集时,会系统性地偏好推理步骤更长(即每步 token 更多)而非质量更高的样本,这种现象被称为“步长混淆”。定量分析表明,这是由于推理步骤中首 token 概率较低所致,较长的步骤稀释了其影响,从而抬高了平均对数概率。为此,作者提出了两种变体方法:ASLEC-DROP(计算时忽略首 token 概率)和 ASLEC-CASL(应用因果去偏回归消除首 token 的混淆效应)。实验证明该方法能有效缓解步长混淆问题。

AI 推荐理由

论文核心研究大模型推理数据选择中的步长混淆问题,直接提升推理能力。

研究机构
College of Computer Science and Technology, Jilin University Key Laboratory of Symbolic Computation and Knowledge Engineering, MoE, Jilin University Alibaba Cloud Computing, School of Artificial Intelligence, Jilin University Department of Mathematics, University of Michigan RIKEN Center for Advanced Intelligence Project
论文信息
作者 Bing Wang, Rui Miao, Chen Shen, Shaotian Yan, Kaiyuan Liu et al.
发布日期 2026-04-08
arXiv ID 2604.06834
相关性评分 9/10 (高度相关)