摘要
工具集成的文本到 SQL 解析将 SQL 生成视为与工具执行交错的序列决策过程。然而,现有强化学习方法主要依赖粗粒度结果监督,导致根本性的信用分配问题:模型对任何产生正确答案的路径给予相同奖励,即便中间步骤冗余或错误。为此,本文提出 FineStep 框架,通过引入独立过程奖励缓解信号稀疏性,设计步级信用分配机制量化每步推理价值,并基于步级优势进行策略优化。实验表明,该方法在 BIRD 基准上达到最先进水平,显著减少冗余工具交互。
AI 推荐理由
论文核心解决工具集成文本到 SQL 中的逐步推理信用分配问题,优化中间推理步骤质量。
研究机构
Institute of Computer Science and Technology, Soochow University, China
Ant Digital Technologies, Ant Group
论文信息