摘要
多轮对话是大语言模型的主要交互形式。现有路由方法在单轮场景中有效,但因交互动态性和奖励延迟,难以最大化多轮对话的累积性能。为此,本文提出从短视的单轮选择转向长程序列路由,并设计了 DialRouter 框架。该方法首先利用蒙特卡洛树搜索(MCTS)探索不同模型选择引发的对话分支,收集高累积奖励轨迹;随后结合基于检索的未来状态近似,从搜索数据中学习轻量级路由策略,实现无需在线搜索的多轮路由。实验表明,DialRouter 在任务成功率上显著优于单一模型及现有基线,并在成本感知奖励下实现了更优的性能 - 成本权衡。
AI 推荐理由
论文利用 MCTS 进行长程对话路径探索与规划,核心解决多步决策问题。
研究机构
School of Computer Science, Shanghai Jiao Tong University, Shanghai, China
WeChat, Tencent Inc, Beijing, China
论文信息