mathematical reasoning inference-time optimization ensemble methods LLM capability
摘要

多数投票机制虽能提升大语言模型的数学推理能力,但错误相关性限制了有效样本量。本文提出“多样化提示混合器”,旨在通过分配结构化不同的推理策略来解耦错误。在 AIMO 3 竞赛中,利用单张 H100 显卡对三个模型进行超过 23 次实验及 50 道 IMO 级别问题测试,结果显示所有干预均失败。研究发现高温采样已足以解耦错误,而较弱的提示策略降低单次准确率的幅度超过了其减少相关性的收益。跨越 17 分的模型能力差距及各类推断时优化尝试表明,模型本身的能力起决定性主导作用。

AI 推荐理由

论文核心研究数学推理中的推断时优化,验证模型能力对推理效果的主导作用。

研究机构
natapong.nitarach@proton.me
论文信息
作者 Natapong Nitarach
发布日期 2026-03-29
arXiv ID 2603.27844
相关性评分 9/10 (高度相关)