摘要
大型语言模型在技术绘图等需严格几何约束的领域常产生幻觉。本文研究从自然语言到精确几何构造的开发生成任务。为此,作者发布了可编程几何 DSL(PyGeoX)及包含 300 个问题的基准测试集。研究发现全局范数奖励会导致“异常梯度掩蔽”现象,即单个异常约束会抵消其他约束的学习信号。针对此问题,提出了饱和加法奖励(SAR)机制,将奖励分解为有界的逐项约束项,以保留部分进展并确保梯度一致性。实验表明,相比基于均方误差的基线,SAR 将高难度任务的解决率提升了 2.3 倍。
AI 推荐理由
论文核心解决 LLM 在几何约束下的逻辑推理与精确生成问题,提出新奖励机制优化推理信号。
研究机构
Huawei Cloud Team
论文信息