推理轨迹 思维树 代码生成 测试时扩展 错误预测
摘要

近期大语言模型研究表明,测试时扩展能显著提升复杂任务(尤其是编码领域)的性能。然而,现有评估多依赖竞赛基准,难以全面反映推理能力。本文系统研究了前沿推理模型在真实世界编码基准上的表现,并提出一种从现有基准自动生成任意难度和结构编码任务的方法。分析发现,推理轨迹的结构而非仅是内容,是预测正确性的强指标。据此,我们提出结构化“思维树”来表示推理轨迹,并训练轻量级分类器预测其正确性。实验表明,基于提取特征标记并重试结构异常的轨迹,能在较低复杂度下获得一致的性能提升。

AI 推荐理由

论文核心研究推理轨迹结构与正确性的关系,提出思维树预测模型准确性。

研究机构
University of California, Berkeley
论文信息
作者 Jiaxin Fang, Runyuan He, Sahil Bhatia, Neel Gajare, Alvin Cheung
发布日期 2026-04-18
arXiv ID 2604.16931
相关性评分 9/10 (高度相关)