摘要
尽管大语言模型进展显著,现有偏好优化方法仍难以在保持推理多样性的同时对齐方向一致性。为此,本文提出方向组级偏好优化(DGPO),这是一种轻量级框架,通过在组级别聚合监督信号,并利用多候选比较显式建模方向感知对齐。DGPO 将正向和反向问答实例组织为结构化集合,优化基于边界的似然目标,以区分连贯的推理路径与不一致的替代方案。这种组级公式比成对目标捕获了更丰富的相对信息,并增强了不同推理路径间的一致性。实证结果表明,构建的反向数据在五个基准测试中平均提升了 3.2%,而 DGPO 在多个数据集和模型家族中均实现了持续增益,平均准确率提升高达 3.6%。
AI 推荐理由
论文核心解决推理一致性问题,通过组级优化提升逻辑推理路径的连贯性与多样性。
研究机构
信息 hub,香港科技大学(广州),中国
香港科技大学 SAR
论文信息