Reasoning Failure Test-time Scaling Failure Analysis Intervention Routing
摘要

针对后训练语言模型在推理任务中的失败,现有方法通常仅增加计算资源进行重试,而忽略失败轨迹的价值。本文提出失败轨迹编码了“可恢复性结构”,即指示何种干预能挽救特定失败。通过提取三个基于干预结构的轨迹特征,而非依赖文本内容,该方法能有效聚类失败模式并表征不同后训练方法的失败拓扑。实验显示,该方法在分类准确率上超越基线 20%,并通过无训练的路由规则,在关键子集上将救援成功率提升 12.2%,将废弃的失败数据转化为诊断工具。

AI 推荐理由

论文核心研究推理失败的结构特征与修复机制,直接针对 LLM 推理能力进行深度分析。

研究机构
1 2 3 4
论文信息
作者 Nizar Islah, Istabrak Abbes, Irina Rish, Sarath Chandar, Eilif B. Muller
发布日期 2026-06-03
arXiv ID 2606.05145
相关性评分 9/10 (高度相关)