LLM Routing Multi-turn Dialogue MCTS Sequential Decision Making
摘要

多轮对话是大语言模型的主要交互形式。现有路由方法在单轮场景中有效,但因交互动态性和奖励延迟,难以最大化多轮对话的累积性能。为此,本文提出从短视的单轮选择转向长程序列路由,并设计了 DialRouter 框架。该方法首先利用蒙特卡洛树搜索(MCTS)探索不同模型选择引发的对话分支,收集高累积奖励轨迹;随后结合基于检索的未来状态近似,从搜索数据中学习轻量级路由策略,实现无需在线搜索的多轮路由。实验表明,DialRouter 在任务成功率上显著优于单一模型及现有基线,并在成本感知奖励下实现了更优的性能 - 成本权衡。

AI 推荐理由

论文利用 MCTS 进行长程对话路径探索与规划,核心解决多步决策问题。

研究机构
School of Computer Science, Shanghai Jiao Tong University, Shanghai, China WeChat, Tencent Inc, Beijing, China
论文信息
作者 Jiarui Zhang, Xiangyu Liu, Yong Hu, Chaoyue Niu, Hang Zeng et al.
发布日期 2026-04-14
arXiv ID 2604.12385
相关性评分 9/10 (高度相关)