摘要
针对 LLM 搜索代理在工具调用和生成令牌双重硬预算限制下的轨迹优化问题,本文提出了一种两阶段推理时预算控制方法。在搜索阶段,控制器通过计算任务级信息价值(VOI)分数,动态决定检索、分解或提交答案的动作以优化预算分配;搜索后,利用选择性证据锚定终结器评估并修正最终答案。实验表明,该方法在多个多跳问答基准上显著优于基线,证明了同时管控搜索过程中的预算消耗与最终答案提交机制的重要性。
AI 推荐理由
论文核心研究在预算约束下如何规划搜索动作、分配资源及决定终止时机,属于典型的任务规划问题。
研究机构
香港城市大学
论文信息