摘要
大型推理模型(LRMs)在复杂推理任务中表现优异,但常对恶意查询生成有害响应。本文探究其根本原因,指出问题源于推理结构本身。基于此,作者提出通过改变推理结构实现有效安全对齐,并设计了 AltTrain 方法。该方法仅需少量监督微调数据,无需复杂强化学习,即可在多种模型和任务场景中实现强大的安全对齐与泛化能力。
AI 推荐理由
论文核心研究推理结构对安全对齐的影响,提出改变推理结构的方法,属于推理机制的核心研究。
研究机构
KAIST
论文信息