Instruction Following Neuro-Symbolic Logical Consistency Constraint Satisfaction
摘要

大语言模型常面临来自不同权威源的异构指令冲突。现有研究多关注对抗攻击,忽视了实际应用中常见的良性冲突。本文提出神经符号层次对齐(NSHA)方法,通过显式建模指令优先级来解决该问题。在推理阶段,引入求解器引导的推理,将指令解析构建为约束满足问题,以推导最大一致性指令集;在训练阶段,利用自动构建的监督信号将求解器决策蒸馏至模型参数。实验表明,该方法在规则遵循、任务执行及安全性方面显著提升了冲突场景下的性能。

AI 推荐理由

提出神经符号推理方法解决指令冲突,核心在于逻辑一致性与约束满足推理。

研究机构
King Abdullah University of Science and Technology (KAUST) University of Liverpool University of Edinburgh
论文信息
作者 Shu Yang, Zihao Zhou, Di Wang, Wenda Li
发布日期 2026-04-10
arXiv ID 2604.09075
相关性评分 9/10 (高度相关)