Test-time Scaling Reinforcement Learning Adaptive Sampling Reasoning Efficiency
摘要

测试时扩展能提升大语言模型的推理性能,但带来巨大的计算成本和延迟。现有自适应采样方法虽能动态决定停止时机,却多依赖启发式规则或分布假设。本文将其建模为马尔可夫决策过程,训练轻量级强化学习控制器,以平衡答案正确性、延迟与计算成本。该方法仅依赖最终答案统计信息,可在 CPU 上部署,并可解释为带显式预算约束的拉格朗日松弛。实验表明,其在正确性与采样效率间优于现有基线。

AI 推荐理由

论文核心研究通过自适应采样提升 LLM 推理性能,直接优化推理过程中的成本与准确率权衡。

研究机构
University of North Carolina at Chapel Hill University of Maryland, College Park Washington University in St. Louis
论文信息
作者 Runpeng Dai, Tong Zheng, Rui Liu, Chengsong Huang, Hongtu Zhu
发布日期 2026-06-02
arXiv ID 2606.03102
相关性评分 9/10 (高度相关)