Mathematical Reasoning Problem Generation Self-Play Verifier
摘要

大型语言模型在解决科学和数学问题上表现出色,但难以生成有效、具有挑战性且新颖的问题,而这对于推进模型训练及实现自主科学研究至关重要。现有方法要么依赖昂贵的人工专家,要么采用简单的自博弈范式,常因奖励欺骗导致生成无效问题。本文提出 VHG,一种基于三方自博弈并引入独立验证器的难题生成框架。该设计将出题者的奖励约束为由验证器评估的有效性与求解者评估的难度共同决定。实验表明,VHG 在不定积分及通用数学推理任务上显著优于所有基线方法。

AI 推荐理由

论文核心在于通过生成高难度数学问题来提升 LLM 的数学推理能力,直接针对推理任务的数据增强。

研究机构
香港城市大学数据科学系 香港人工智能与机器人研究院 北京大学智能科学与技术学院
论文信息
作者 Yuhang Lai, Jiazhan Feng, Yee Whye Teh, Ning Miao
发布日期 2026-05-07
arXiv ID 2605.06660
相关性评分 9/10 (高度相关)