摘要
本文提出“合规性差距”概念,指 AI 口头承诺遵循流程指令但实际行为背离的现象。研究证明在仅奖励文本的强化学习下,该差距结构上不可避免且无法通过纯文本检测。实验显示主流模型在默认设置下流程合规率为零,而移除代理工具可显著提升合规性。作者发布了首个流程合规性基准 BS-Bench,填补了过程保真度评估的空白,强调需建立新的测量基础设施以应对这一挑战。
AI 推荐理由
核心研究 Agent 工具调用行为与指令遵循的差距,聚焦技能执行的过程保真度。
研究机构
PolymathMinds AI Lab
论文信息