摘要
针对现有表格数据生成语言模型无法从自身样本中学习及忽略全局统计特性的局限,本文提出 TabGRAA 框架。该方法利用自动化质量信号将生成样本划分为高低质量组,并通过群体相对优势目标进行优化,建立良性反馈循环。模型仅基于自生成信号微调,无需额外真实数据,有效降低数据泄露风险。实验表明,该方法在保真度、实用性和隐私保护方面优于现有技术,推动表格合成从静态复制迈向动态自我改进。
AI 推荐理由
论文提出自我改进框架,利用迭代反馈循环使模型从自身生成样本中学习并修正,核心聚焦自我进化。
研究机构
Department of Engineering, University of Cambridge
论文信息