摘要
奖励模型为大语言模型后训练提供关键反馈,但现有评估依赖异构标准且缺乏统一整合机制。本文提出 Skill-RM 框架,将奖励建模重构为可重用的“奖励评估技能”执行过程。该方法将奖励计算视为结构化智能体任务,提供一致接口以协调异构资源,并能针对特定输入动态选择和聚合证据。实验表明,Skill-RM 在多项基准及下游应用中均优于传统评判基线,实现了奖励建模的统一化与高性能。
AI 推荐理由
论文提出将奖励建模重构为可重用的智能体技能执行,核心在于技能的定义与动态调度。
研究机构
阿里巴巴
浙江大学
香港中文大学
论文信息