摘要
大型语言模型在不同场景下常表现出异质的道德偏好。本研究探讨如何在推理阶段引导模型朝向特定伦理框架,同时保持其通用能力。我们提出“收敛 - 发散路由”方法,追踪并编辑 Transformer 块内伦理相关路径首次汇聚后分岔的最小分支点,通过门控非目标分支阻断下游传播。为实现细粒度控制,我们将公共空间模式适配至残差流,提取区分功利主义与义务论框架的方向向量,并引入“双对数校准”技术,在二维子空间内调整残差以对齐用户偏好权重。实验表明该方法能有效校准道德推理偏好且保留通用能力。
AI 推荐理由
论文核心研究道德推理的干预机制,通过编辑模型内部路径实现推理导向控制。
研究机构
慕尼黑大学计算机学院
慕尼黑大学信息学、技术与社会科学院
慕尼黑大学机器学习中心
论文信息