Tool Use Structural Alignment Bias Mechanism Analysis LLM Safety
摘要

大语言模型在利用外部工具方面表现出色,但在面对与用户查询无关的工具时,往往未能正确拒绝调用。本文发现了一种被忽视的机制缺陷——“结构性对齐偏差”:即使用户目标无法达成,只要查询属性能匹配工具参数,模型仍倾向于调用工具。为此,我们提出了 SABEval 数据集以解耦结构对齐与语义相关性,并设计了对比注意力归因方法,揭示了语义检查与结构匹配两条竞争路径。基于此,我们提出重平衡策略,有效缓解了该偏差且未损害通用工具使用能力。

AI 推荐理由

论文核心研究 LLM 工具调用中的结构性对齐偏差机制,直接关乎技能学习的准确性与决策逻辑。

研究机构
中国科学院信息工程研究所,北京,中国 中国科学院大学网络空间安全学院,北京,中国
论文信息
作者 Yilong Liu, Xixun Lin, Pengfei Cao, Ge Zhang, Fang Fang et al.
发布日期 2026-04-13
arXiv ID 2604.11322
相关性评分 9/10 (高度相关)