Multi-turn Reasoning Compute Efficiency Adaptive Budgeting GRPO
摘要

随着大语言模型推理性能趋于饱和,提升推理时的计算效率以缓解过度思考和冗长轨迹至关重要。现有方法多关注单轮场景,忽视了多轮推理中的序列依赖性。本文将其建模为多目标马尔可夫决策过程,提出 TAB(回合自适应预算)策略。该方法通过群相对策略优化训练,依据对话历史动态分配令牌预算,对简单回合节省资源,为关键难点预留空间。实验表明,TAB 在保持数学推理准确率的同时,较静态基线节省高达 35% 的令牌消耗。

AI 推荐理由

论文核心研究多轮推理中的计算资源分配,直接优化推理效率与准确率权衡。

研究机构
Carnegie Mellon University
论文信息
作者 Neharika Jali, Anupam Nayak, Gauri Joshi
发布日期 2026-04-06
arXiv ID 2604.05164
相关性评分 9/10 (高度相关)