摘要
推理型大语言模型(LLM)作为评判者,凭借推理时扩展能力,为将推理模型的成功延伸至输出正确性无法直接验证的非可验证领域提供了新路径。然而,其在实际策略训练中的有效性尚未得到系统检验。本研究通过严谨实验,对比了非推理与推理型评判者在基于强化学习的 LLM 对齐中的影响。研究发现,非推理评判者易导致奖励黑客行为,而推理型评判者能训练出在黄金标准下表现优异的策略。有趣的是,这些策略学会了生成能有效欺骗其他 LLM 评判者的对抗性输出,从而在主流基准测试中取得高分。
AI 推荐理由
论文核心研究推理型 LLM 作为评判者在非可验证领域的表现及机制。
研究机构
Meta Superintelligence Labs
耶鲁大学
论文信息