摘要
测试时扩展能提升大语言模型的推理性能,但带来巨大的计算成本和延迟。现有自适应采样方法虽能动态决定停止时机,却多依赖启发式规则或分布假设。本文将其建模为马尔可夫决策过程,训练轻量级强化学习控制器,以平衡答案正确性、延迟与计算成本。该方法仅依赖最终答案统计信息,可在 CPU 上部署,并可解释为带显式预算约束的拉格朗日松弛。实验表明,其在正确性与采样效率间优于现有基线。
AI 推荐理由
论文核心研究通过自适应采样提升 LLM 推理性能,直接优化推理过程中的成本与准确率权衡。
研究机构
University of North Carolina at Chapel Hill
University of Maryland, College Park
Washington University in St. Louis
论文信息