摘要
现代基于思维链的 LLM 代理虽精度高但推理成本巨大。静态策略难以兼顾性能与成本,而理想方案应根据任务步骤难度动态调整推理力度。本文提出 Ares 框架,通过轻量级路由器基于交互历史预测每一步所需的最低推理等级。我们构建了数据生成流水线以识别成功完成步骤所需的最小推理努力,并据此微调路由器,实现即插即用。实验表明,Ares 在多种代理任务中将推理 token 用量最高降低 52.7%,且任务成功率几乎无损。
AI 推荐理由
论文核心提出动态推理努力选择框架,直接优化 LLM 代理的推理效率与成本平衡。
研究机构
Department of Computer Science, University of California, Santa Barbara
论文信息