摘要
本文提出一种开源方法,使用户能通过自然语言查询非文本结构化数据集。不同于难以处理数值和高度结构化信息的检索增强生成(RAG),该方法训练大语言模型生成可执行查询。为此,作者引入了一套原则性的合成训练数据生成流程,产出涵盖用户意图与数据语义的多样问答对。研究基于 QLoRA 和 4 比特量化微调了紧凑型 DeepSeek R1 Distill 8B 模型,使其适用于普通硬件部署。在西班牙 Durangaldea 基本服务可达性数据集上的评估显示,该模型在单语、多语及未见地点场景中均表现出高精度与鲁棒泛化能力,证明了小型领域专用模型在不依赖大型专有 LLM 的情况下也能实现高精度查询生成。
AI 推荐理由
论文核心在于训练 LLM 生成可执行查询(工具使用),属于典型的技能学习与 API 调用范畴。
研究机构
National University of Science and Technology POLITEHNICA Bucharest
Institute of Communication and Computer Systems (ICCS), Athens, Greece
论文信息