摘要
大型语言模型虽能通过思维链提示解决多种推理任务,但小型模型(约 70-80 亿参数)在计算和令牌预算紧张时仍难以进行多步推理。现有测试时推理方法如自一致性、思维树及批判修正循环虽能提升性能,但往往令牌成本高昂且缺乏细粒度的步骤控制。本项目旨在填补这一空白:小型语言模型能否使用相同或更少的令牌进行可靠推理?该方法通过过程监督和简单的测试时控制(如令牌预算和冗余步骤拒绝),探索其替代模型规模或大量采样的可能性,具有显著的科学与实用价值。
AI 推荐理由
论文核心研究小模型在预算限制下的多步推理能力,提出双轨思维链方法。
研究机构
University of Massachusetts
论文信息