摘要
大型推理模型在数学推理任务中表现强劲,但在困难实例上仍不可靠。现有测试时扩展方法虽能提升性能,但计算成本高且在难题上收益递减。本文发现输出分歧与实例难度及预测正确性高度相关,据此提出一种无需训练的框架,将测试时扩展建模为实例级路由问题。该框架根据输出分歧程度动态选择策略:一致时轻量解析,中度分歧时多数投票,高度模糊时基于重写的重构。实验表明,该方法在七个数学基准上准确率提升 3%-7%,同时降低了采样成本。
AI 推荐理由
论文核心针对数学推理任务,提出基于分歧的测试时扩展策略以提升推理准确性。
研究机构
School of Computer Science and Technology, Soochow University
Department of Foundation Model, 2012 Labs, Huawei
Harbin Institute of Technology, Shenzhen (HITSZ)
论文信息