Text-to-SQL Reinforcement Learning Credit Assignment Tool Use
摘要

工具集成的文本到 SQL 解析将 SQL 生成视为与工具执行交错的序列决策过程。然而,现有强化学习方法主要依赖粗粒度结果监督,导致根本性的信用分配问题:模型对任何产生正确答案的路径给予相同奖励,即便中间步骤冗余或错误。为此,本文提出 FineStep 框架,通过引入独立过程奖励缓解信号稀疏性,设计步级信用分配机制量化每步推理价值,并基于步级优势进行策略优化。实验表明,该方法在 BIRD 基准上达到最先进水平,显著减少冗余工具交互。

AI 推荐理由

论文核心解决工具集成文本到 SQL 中的逐步推理信用分配问题,优化中间推理步骤质量。

研究机构
Institute of Computer Science and Technology, Soochow University, China Ant Digital Technologies, Ant Group
论文信息
作者 Yaxun Dai, Baolin Sun, Junying Wang, Pengfei Wang, Yingqi Gao et al.
发布日期 2026-05-06
arXiv ID 2605.04719
相关性评分 9/10 (高度相关)