摘要
随着大语言模型推理性能趋于饱和,提升推理时的计算效率以缓解过度思考和冗长轨迹至关重要。现有方法多关注单轮场景,忽视了多轮推理中的序列依赖性。本文将其建模为多目标马尔可夫决策过程,提出 TAB(回合自适应预算)策略。该方法通过群相对策略优化训练,依据对话历史动态分配令牌预算,对简单回合节省资源,为关键难点预留空间。实验表明,TAB 在保持数学推理准确率的同时,较静态基线节省高达 35% 的令牌消耗。
AI 推荐理由
论文核心研究多轮推理中的计算资源分配,直接优化推理效率与准确率权衡。
研究机构
Carnegie Mellon University
论文信息