摘要
测试时扩展(TTS)通过增加推理计算提升大模型性能,但现有策略多依赖人工设计。本文提出 AutoTTS 框架,将研究重点从设计启发式规则转向构建可自动发现 TTS 策略的环境。该方法将宽度 - 深度 TTS 建模为控制器合成问题,利用预收集的推理轨迹和探测信号,使控制器能低成本地决定分支、剪枝或停止。引入 Beta 参数化和细粒度执行反馈以提高搜索效率。实验表明,自动发现的策略在数学推理基准上优于人工基线,且具有泛化性,发现过程成本低廉。
AI 推荐理由
论文核心是通过自动发现推理策略来优化测试时计算分配,直接提升数学推理能力。
研究机构
UMD
WUSTL
UNC
Google
Meta
论文信息