摘要
大型推理模型(LRMs)擅长长链推理,但常难以遵循输出格式等指令。本文提出 RAIN-Merging,一种无需梯度的模型合并方法,旨在将指令微调模型融入 LRM。该方法通过将任务向量投影至思维标记的正交零空间,保留了结构化推理机制;并利用指令注意力估计进行模块级缩放,以增强指令相关性。实验表明,该方法在显著提升指令遵循能力的同时,有效维持了原有的推理质量与思维格式。
AI 推荐理由
论文核心解决大型推理模型指令遵循问题,同时严格保留其思维链格式与推理能力。
研究机构
上海交通大学图像处理与模式识别研究所,自动化与智能传感学院
香港科技大学系统控制与信息工程系(深圳)
论文信息