摘要
推理时扩展(ITS)在数学等可验证领域成效显著,但在易受系统性错误影响的开放任务中受限。本文提出利用并行样本集的内在统计量(如长度调整尾熵)作为无需真值的解质量判别信号。通过内在选择(iS)进行候选排序,内在粒子滤波(iPF)实现步级重采样以引导高置信度推理轨迹,以及粒子蒸馏(dPF)结合早期逻辑混合纠正系统性错误。该方法无需奖励模型或精确验证,即可在多种架构上显著提升了数学解题及临床响应等复杂推理任务的性能。
AI 推荐理由
论文核心研究利用内在统计信号优化推理轨迹选择与重采样,显著提升复杂推理任务表现。
研究机构
AI Innovation, Red Hat
DeCoDE Lab, MIT
论文信息