摘要
本文提出“潜在价值假设”,解释为何基于 AI 反馈的强化学习(RLAIF)能通过自我偏好判断提升模型。研究认为预训练数据将人类价值观编码为表示空间方向,宪法提示可激活这些潜在价值。理论分析表明,当激活方向优于默认生成方向时,RLAIF 能改善对齐;其质量上限取决于表征编码能力;同时存在激活反社会价值的对抗性宪法。该理论统一了拒绝方向、低维安全子空间等实证发现。
AI 推荐理由
论文核心探讨 RLAIF 如何实现模型自我改进与价值对齐,属于自我进化机制的理论解释。
研究机构
剑桥大学计算机科学与技术系
论文信息