Text-to-SQL Process Supervision Reward Modeling Error Localization
摘要

Text-to-SQL 系统通常仅依赖查询级执行正确性进行评估,缺乏对中间决策失误的指导。针对令牌级监督的局限性,本文提出 CAPER 方法,通过在 SQL 抽象语法树上进行反事实干预,自动推导子句级监督信号,实现奖励建模中的根本原因错误定位。基于此数据训练的轻量级子句过程奖励模型(Clause-PRM),可为策略优化提供细粒度反馈。实验表明,该方法在 BIRD 和 Spider 数据集上显著提升了执行准确率及故障定位能力。

AI 推荐理由

提出子句级过程监督,通过反事实干预定位推理错误根源,显著增强 SQL 生成中的逻辑推理与纠错能力。

研究机构
西北工业大学 香港大学 深圳大学
论文信息
作者 Lujie Ban, Jiasheng Shi, Jinyang Li, Xiaolin Han, Tsz Nam Chan et al.
发布日期 2026-06-02
arXiv ID 2606.03327
相关性评分 9/10 (高度相关)