摘要
大型语言模型虽推动了 Text-to-SQL 进展,但存在高成本与隐私隐患。小型语言模型(SLM)虽高效却受限于推理能力弱及指令遵循差。针对传统强化学习稀疏奖励导致训练不稳定的问题,本文提出 FINER-SQL 框架。该框架基于组相对策略优化,利用细粒度执行反馈替代稀疏监督,引入“记忆奖励”对齐语义轨迹,“原子奖励”衡量操作级重叠以提供部分得分。实验表明,3B 模型在 BIRD 和 Spider 基准上执行准确率分别达 67.73% 和 85%,媲美大模型且延迟显著降低,为高效隐私的 Text-to-SQL 生成提供了新路径。
AI 推荐理由
论文核心解决小模型在 Text-to-SQL 中的弱推理问题,通过细粒度反馈增强推理稳定性。
研究机构
Griffith University (Australia)
Humboldt-Universität zu Berlin (Germany)
The University of Queensland (Australia)
论文信息