Reasoning Models Alignment Trustworthiness Post-training
摘要

指令微调的大语言模型常通过后训练转化为推理模型以提升多步任务性能,但此过程往往优化推理准确率而忽视保留原有的对齐行为(如安全拒绝、偏见规避)。本文通过可信度审计发现,默认情况下该转化无法保持行为一致性。研究对比了监督微调、基于强化学习的后训练及蒸馏生成的推理模型,在六个可信度维度上进行系统评估。结果显示,推理模型虽提升了推理基准表现,却出现毒性增加、刻板印象放大等对齐退化现象。结论强调评估推理模型时必须纳入可信度指标。

AI 推荐理由

论文核心研究推理模型的后训练过程及其对对齐行为的影响,直接聚焦推理能力构建。

研究机构
University of Colorado Boulder University of Central Florida University of Maryland College Park University of Wisconsin-Madison
论文信息
作者 Prajakta Kini, Avinash Reddy, Souradip Chakraborty, Satya Sai Srinath Namburi GNVV, Furong Huang et al.
发布日期 2026-06-09
arXiv ID 2606.11046
相关性评分 9/10 (高度相关)