Reinforcement Learning Dialogue Policy Legal AI Proactive Agent
摘要

现有对话系统多为用户驱动,旨在响应用户请求。然而在许多关键场景中,对话代理需主动提取信息以达成自身目标。为此,本文引入“探究型对话代理(ICA)”,并针对美国最高法院口头辩论开发专用 ICA。我们提出一种双层分层强化学习框架,包含两个协作的 RL 代理,分别负责战略对话管理与细粒度话语生成。通过学习何时及如何提出探究性问题,该代理模拟司法询问模式,系统性地挖掘关键信息以履行法律目标。在美国最高法院数据集上的评估表明,该方法在多项指标上优于各类基线。

AI 推荐理由

论文提出双层强化学习框架进行策略性对话管理,核心在于主动规划提问以实现目标。

研究机构
Georgetown University Singapore Management University
论文信息
作者 Xubo Lin, Zezhii Deng, Shihao Wang, Grace Hui Yang, Yang Deng
发布日期 2026-05-13
arXiv ID 2605.14057
相关性评分 8/10 (高度相关)