摘要
针对现实企业环境中数据库模式庞大且含噪的问题,本文提出 TRUST-SQL 框架,摒弃全模式假设,转而让 Agent 在未知模式下主动识别并验证相关子集。该方法将任务建模为部分可观测马尔可夫决策过程,采用四阶段协议将推理 grounded 于已验证元数据。核心创新在于双轨 GRPO 策略,通过 token 级掩码优势隔离探索奖励与执行结果,有效解决信用分配问题。实验表明,该框架在无预加载元数据情况下,显著优于依赖模式预填充的基线模型。
AI 推荐理由
论文核心研究 Agent 在未知模式下主动选择和使用工具(元数据验证)的技能,通过强化学习优化该过程。
研究机构
北京邮电大学邮政与电信学院,北京,中国
国家关键处理器实验室,中国科学院计算技术研究所,CAS
论文信息