Mathematical Reasoning Preference Optimization Neuron Guidance Post-training
摘要

偏好优化已成为提升大语言模型推理能力的重要后训练范式。现有方法多依赖外部构建的偏好数据,却鲜少利用模型内部表征中的能力相关信息。针对数学推理,特定神经元群的激活模式可反映数学知识或逻辑推理状态。本文提出 YFPO(耦合特征偏好优化),一种初步的神经元引导偏好优化框架。该方法首先利用 AttnLRP 识别数学相关神经元,随后基于优选与非优选响应间的激活差异构建辅助奖励,将内部神经元信号融入外部偏好学习。在 GSM8K 基准上的实验表明,该机制能有效交互并偶尔提升推理性能,为细粒度、可解释的推理导向后训练提供了新方向。

AI 推荐理由

论文核心提出利用神经元引导的偏好优化框架,专门针对提升大模型的数学推理能力。

研究机构
浙江大学
论文信息
作者 Yifan Le
发布日期 2026-05-12
arXiv ID 2605.11906
相关性评分 9/10 (高度相关)