Commonsense Reasoning Synthetic Data Data Generation LLM Fine-tuning
摘要

对话代理不仅需生成高质量的常识性回复,还需考虑多种合理替代场景以体现多样性。然而,缺乏大规模高质量多样化常识训练数据集严重阻碍了该领域进展。现有数据集因标注成本高而规模小、场景窄。为此,本文提出两阶段方法构建首个多样化生成式常识推理合成数据集 CommonSyn。实验表明,基于该数据微调的模型在不同规模大语言模型上,其生成多样性与质量均优于基线及人工数据集微调模型。

AI 推荐理由

论文核心聚焦于生成多样化常识推理数据,直接提升模型的常识推理能力与质量。

研究机构
利物浦大学
论文信息
作者 Tianhui Zhang, Bei Peng, Danushka Bollegala
发布日期 2026-03-18
arXiv ID 2603.18361
相关性评分 9/10 (高度相关)