Test-Time Scaling Mathematical Reasoning Strategy Routing Output Disagreement
摘要

大型推理模型在数学推理任务中表现强劲,但在困难实例上仍不可靠。现有测试时扩展方法虽能提升性能,但计算成本高且在难题上收益递减。本文发现输出分歧与实例难度及预测正确性高度相关,据此提出一种无需训练的框架,将测试时扩展建模为实例级路由问题。该框架根据输出分歧程度动态选择策略:一致时轻量解析,中度分歧时多数投票,高度模糊时基于重写的重构。实验表明,该方法在七个数学基准上准确率提升 3%-7%,同时降低了采样成本。

AI 推荐理由

论文核心针对数学推理任务,提出基于分歧的测试时扩展策略以提升推理准确性。

研究机构
School of Computer Science and Technology, Soochow University Department of Foundation Model, 2012 Labs, Huawei Harbin Institute of Technology, Shenzhen (HITSZ)
论文信息
作者 Zhimin Lin, Yixin Ji, Jinpeng Li, Yu Luo, Dong Li et al.
发布日期 2026-04-29
arXiv ID 2604.26644
相关性评分 9/10 (高度相关)