Iterative Finetuning Self-Improvement Model Alignment Trait Amplification
摘要

本文研究了当模型基于自身输出进行训练时,其行为倾向(如奉承或不对齐)是否会在下一代模型中被放大。通过在监督微调、合成文档微调和直接偏好优化三种设置下训练系列模型,发现非强化学习场景中特征多会衰减或保持不变,仅在持续后训练且偏好自身输出时才会可靠放大。结果表明,限制持续后训练阶段可有效防御特征放大,且放大与连贯性的权衡构成了自然威慑。

AI 推荐理由

研究模型在自我生成数据上的迭代微调,核心探讨自我进化中的行为放大与衰减机制。

研究机构
University of Chicago
论文信息
作者 Zephaniah Roe, Jack Sanderson, Dang Nguyen, Julian Huang, Todd Nief et al.
发布日期 2026-05-01
arXiv ID 2605.01130
相关性评分 9/10 (高度相关)