Moral Reasoning Inference-time Steering Interpretability LLM Control
摘要

大型语言模型在不同场景下常表现出异质的道德偏好。本研究探讨如何在推理阶段引导模型朝向特定伦理框架,同时保持其通用能力。我们提出“收敛 - 发散路由”方法,追踪并编辑 Transformer 块内伦理相关路径首次汇聚后分岔的最小分支点,通过门控非目标分支阻断下游传播。为实现细粒度控制,我们将公共空间模式适配至残差流,提取区分功利主义与义务论框架的方向向量,并引入“双对数校准”技术,在二维子空间内调整残差以对齐用户偏好权重。实验表明该方法能有效校准道德推理偏好且保留通用能力。

AI 推荐理由

论文核心研究道德推理的干预机制,通过编辑模型内部路径实现推理导向控制。

研究机构
慕尼黑大学计算机学院 慕尼黑大学信息学、技术与社会科学院 慕尼黑大学机器学习中心
论文信息
作者 Chenchen Yuan, Zheyu Zhang, Gjergji Kasneci
发布日期 2026-05-05
arXiv ID 2605.03609
相关性评分 9/10 (高度相关)