Moral Reasoning Explainability Representation Analysis Activation Steering
摘要

大语言模型日益参与道德敏感决策,但其推理步骤中的伦理框架组织机制尚不明确。本文提出“道德推理轨迹”概念,分析中间推理步骤中伦理框架调用的动态变化。研究发现道德推理涉及系统的多框架审议,连续步骤中框架切换频繁,且不稳定轨迹更易受说服攻击。通过线性探测定位了特定层的框架编码,并利用轻量级激活 Steering 调节框架整合模式。此外,提出了与模型连贯性强相关的道德表示一致性指标,并经人工标注验证。

AI 推荐理由

论文核心研究道德推理轨迹、框架切换及推理稳定性,属推理能力深度分析。

研究机构
印第安纳大学布卢明顿分校
论文信息
作者 Fan Huang, Haewoon Kwak, Jisun An
发布日期 2026-03-16
arXiv ID 2603.16017
相关性评分 9/10 (高度相关)