Table QA Reinforcement Learning Pipeline Generation Efficiency
摘要

表格问答(TQA)旨在回答基于结构化表格的自然语言问题。现有基于算子的最先进方法通过多步方式生成表格操作流水线,但依赖多次 LLM 调用,导致延迟和成本过高。本文提出 Operation-R1,这是首个利用带有可验证奖励的新型强化学习变体训练轻量级 LLM 的框架,能在单次推理中生成高质量的数据准备流水线。该方法引入自监督奖励机制获取细粒度监督信号,并提出方差感知组重采样以缓解训练不稳定。此外,开发了操作合并与自适应回滚两种机制以增强鲁棒性。实验表明,该方法在显著降低成本的同时,准确率优于多步基线。

AI 推荐理由

论文核心在于将多步任务规划压缩为单步生成,直接优化数据准备流水线的规划效率与质量。

研究机构
浙江大学, 杭州, 中国 东北大学, 沈阳, 中国 奥尔堡大学, 奥尔堡, 丹麦
论文信息
作者 Fengyu Li, Junhao Zhu, Kaishi Song, Lu Chen, Zhongming Yao et al.
发布日期 2026-02-26
arXiv ID 2602.22721
相关性评分 9/10 (高度相关)