Text-to-SQL Reinforcement Learning Tool Use Unknown Schema Agent
摘要

针对现实企业环境中数据库模式庞大且含噪的问题,本文提出 TRUST-SQL 框架,摒弃全模式假设,转而让 Agent 在未知模式下主动识别并验证相关子集。该方法将任务建模为部分可观测马尔可夫决策过程,采用四阶段协议将推理 grounded 于已验证元数据。核心创新在于双轨 GRPO 策略,通过 token 级掩码优势隔离探索奖励与执行结果,有效解决信用分配问题。实验表明,该框架在无预加载元数据情况下,显著优于依赖模式预填充的基线模型。

AI 推荐理由

论文核心研究 Agent 在未知模式下主动选择和使用工具(元数据验证)的技能,通过强化学习优化该过程。

研究机构
北京邮电大学邮政与电信学院,北京,中国 国家关键处理器实验室,中国科学院计算技术研究所,CAS
论文信息
作者 Ai Jian, Xiaoyun Zhang, Wanrou Du, Jingqing Ruan, Jiangbo Pei et al.
发布日期 2026-03-17
arXiv ID 2603.16448
相关性评分 9/10 (高度相关)