摘要
Text-to-SQL 系统通常仅依赖查询级执行正确性进行评估,缺乏对中间决策失误的指导。针对令牌级监督的局限性,本文提出 CAPER 方法,通过在 SQL 抽象语法树上进行反事实干预,自动推导子句级监督信号,实现奖励建模中的根本原因错误定位。基于此数据训练的轻量级子句过程奖励模型(Clause-PRM),可为策略优化提供细粒度反馈。实验表明,该方法在 BIRD 和 Spider 数据集上显著提升了执行准确率及故障定位能力。
AI 推荐理由
提出子句级过程监督,通过反事实干预定位推理错误根源,显著增强 SQL 生成中的逻辑推理与纠错能力。
研究机构
西北工业大学
香港大学
深圳大学
论文信息