Text-to-SQL Small Language Models Reinforcement Learning Fine-grained Feedback
摘要

大型语言模型虽推动了 Text-to-SQL 进展,但存在高成本与隐私隐患。小型语言模型(SLM)虽高效却受限于推理能力弱及指令遵循差。针对传统强化学习稀疏奖励导致训练不稳定的问题,本文提出 FINER-SQL 框架。该框架基于组相对策略优化,利用细粒度执行反馈替代稀疏监督,引入“记忆奖励”对齐语义轨迹,“原子奖励”衡量操作级重叠以提供部分得分。实验表明,3B 模型在 BIRD 和 Spider 基准上执行准确率分别达 67.73% 和 85%,媲美大模型且延迟显著降低,为高效隐私的 Text-to-SQL 生成提供了新路径。

AI 推荐理由

论文核心解决小模型在 Text-to-SQL 中的弱推理问题,通过细粒度反馈增强推理稳定性。

研究机构
Griffith University (Australia) Humboldt-Universität zu Berlin (Germany) The University of Queensland (Australia)
论文信息
作者 Thanh Dat Hoang, Thanh Trung Huynh, Matthias Weidlich, Thanh Tam Nguyen, Tong Chen et al.
发布日期 2026-05-05
arXiv ID 2605.03465
相关性评分 9/10 (高度相关)