摘要
跨域任务导向对话需在隐式和显式可行性约束下进行推理,并规划长程多轮行动。大语言模型(LLM)虽能推断约束,但在长程任务中不可靠;强化学习(RL)虽能优化长程行为,却无法从原始对话中恢复约束。为此,本文提出验证式 LLM 知识赋能 RL(VLK-RL)混合框架。该框架首先利用 LLM 提取候选约束,再通过双重角色交叉审查机制抑制幻觉与跨轮不一致性。经验证的约束被映射为本体对齐的槽值表示,为 RL 策略优化提供结构化、感知约束的状态空间。实验表明,该方法在长程任务上显著提升了泛化性与鲁棒性。
AI 推荐理由
论文核心解决跨域长程多轮对话中的任务规划问题,结合推理与强化学习优化长视野行为。
研究机构
School of Computer Science and Engineering, Central South University
Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen
University of Science and Technology Beijing
论文信息