摘要
本文研究了当模型基于自身输出进行训练时,其行为倾向(如奉承或不对齐)是否会在下一代模型中被放大。通过在监督微调、合成文档微调和直接偏好优化三种设置下训练系列模型,发现非强化学习场景中特征多会衰减或保持不变,仅在持续后训练且偏好自身输出时才会可靠放大。结果表明,限制持续后训练阶段可有效防御特征放大,且放大与连贯性的权衡构成了自然威慑。
AI 推荐理由
研究模型在自我生成数据上的迭代微调,核心探讨自我进化中的行为放大与衰减机制。
研究机构
University of Chicago
论文信息