Backtracking Dynamics Reasoning Traces Self-Correction Early Exit LLM Analysis
摘要

推理模型常生成长轨迹,其中有效的自我修正与低效的修订难以区分。本文通过研究长形式推理轨迹内的局部重考虑、撤回或重新推导等回溯动态来探讨这一区别。基于 6000 条 Qwen3-8B 在 AIME 数据集上的轨迹,我们标注了片段级的回溯严重程度,并分析了事件时机、归一化深度及局部爆发结构。研究发现,早期的孤立修复通常与正确推理兼容,而错误轨迹则更多表现为持续且聚集在后期的中重度回溯。跨语料库验证显示该定性不对称性在不同模型/领域对中普遍存在。过滤分析将该信号实例化为前缀因果选择性早退策略:在浅层和中间深度,感知爆发的过滤优于仅基于固定长度的过滤,且仅需前缀可用特征。适度的长度截断仍是强基线,但爆发感知控制提供了一种可部署机制,用于分离可恢复的修复与潜在的 instability。

AI 推荐理由

论文核心研究长推理轨迹中的回溯动态,区分有效修正与无效反复,直接提升推理质量。

研究机构
University of California, Irvine
论文信息
作者 Navid Rezazadeh, Arash Gholami Davoodi
发布日期 2026-05-27
arXiv ID 2605.27965
相关性评分 9/10 (高度相关)