安全对齐 推理结构 监督微调 大型推理模型
摘要

大型推理模型(LRMs)在复杂推理任务中表现优异,但常对恶意查询生成有害响应。本文探究其根本原因,指出问题源于推理结构本身。基于此,作者提出通过改变推理结构实现有效安全对齐,并设计了 AltTrain 方法。该方法仅需少量监督微调数据,无需复杂强化学习,即可在多种模型和任务场景中实现强大的安全对齐与泛化能力。

AI 推荐理由

论文核心研究推理结构对安全对齐的影响,提出改变推理结构的方法,属于推理机制的核心研究。

研究机构
KAIST
论文信息
作者 Yeonjun In, Wonjoong Kim, Sangwu Park, Chanyoung Park
发布日期 2026-04-21
arXiv ID 2604.18946
相关性评分 9/10 (高度相关)