摘要
针对直接偏好优化(DPO)在知识密集型生成中存在的系统性冗长偏差问题,本文提出 RLearner-LLM 及混合 DPO 方法。该方法融合 DeBERTa-v3 自然语言推断信号与验证器 LLM 评分,构建自动化偏好流水线,无需人工标注即可克服单一信号优化的“对齐税”。在生物、医学和法律等领域的评估显示,该方法将 NLI 蕴含率最高提升 6 倍,显著改善了模型逻辑正确性,同时保持输出简洁,证明了在知识密集型任务中采用逻辑感知指标的必要性。
AI 推荐理由
论文核心解决逻辑正确性与流畅度的平衡,显著提升 NLI entailment 指标,属推理能力研究。
研究机构
奥克兰大学
阿尔托大学
论文信息