Task-Oriented Dialogue Hybrid Framework Constraint Reasoning Reinforcement Learning Long-Horizon Planning
摘要

跨域任务导向对话需在隐式和显式可行性约束下进行推理,并规划长程多轮行动。大语言模型(LLM)虽能推断约束,但在长程任务中不可靠;强化学习(RL)虽能优化长程行为,却无法从原始对话中恢复约束。为此,本文提出验证式 LLM 知识赋能 RL(VLK-RL)混合框架。该框架首先利用 LLM 提取候选约束,再通过双重角色交叉审查机制抑制幻觉与跨轮不一致性。经验证的约束被映射为本体对齐的槽值表示,为 RL 策略优化提供结构化、感知约束的状态空间。实验表明,该方法在长程任务上显著提升了泛化性与鲁棒性。

AI 推荐理由

论文核心解决跨域长程多轮对话中的任务规划问题,结合推理与强化学习优化长视野行为。

研究机构
School of Computer Science and Engineering, Central South University Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen University of Science and Technology Beijing
论文信息
作者 Yangyang Zhao, Linfan Dai, Li Cai, Bowen Xing, Libo Qin
发布日期 2026-04-25
arXiv ID 2604.23345
相关性评分 9/10 (高度相关)