摘要
针对语言模型回答表格问题时缺乏可验证性的问题,本文提出 RSAT 方法,训练小型语言模型生成基于单元格引用的逐步推理。该方法包含两阶段:首先通过监督微调学习结构化输出格式,随后利用基于自然语言推理的忠实度奖励进行强化学习优化。实验表明,RSAT 将模型推理的忠实度提升了 3.7 倍,并实现了近乎完美的引用有效性,证明了将归因机制整合进推理过程而非事后添加的必要性。
AI 推荐理由
论文核心研究小模型在表格问答中的逐步推理能力及归因忠实度,直接提升推理质量。
研究机构
Department of Computer Science, The George Washington University, USA
论文信息