摘要
针对开放域奖励建模中缺乏可验证答案时的细微偏好判断难题,本文提出 Eval-Skill 方法。该方法摒弃了传统的在线生成评分标准或参数训练模式,转而将奖励指导重构为上下文进化过程。通过工作流生成与原则生成两个阶段,结合探索与选择机制,仅需少量样本即可合成可复用的领域级评估技能。实验表明,该方法在多个基准测试中显著提升了不同评判模型的性能,为基于大语言模型的评估提供了高效的新范式。
AI 推荐理由
论文提出基于探索的技能进化方法,核心在于评估技能的自我合成与迭代优化。
研究机构
浙江大学
小红书
论文信息