摘要
有效的工具调用未必构成有效的因果干预。现有防护机制无法确保状态改变动作具有可识别的因果效应,尤其在混淆工作流中,观测最优动作执行后可能降低效用。本文提出 CIVeX,一种因果干预验证器,将提议动作映射为结构因果查询,检查可识别性并返回可审计判决。实验表明,在对抗性混淆下,CIVeX 实现了零错误执行,显著优于基于思维链的大模型验证方法,证明了干预可识别性是可靠工具使用的关键缺失原语。
AI 推荐理由
论文核心解决 Agent 工具调用中的因果干预验证问题,直接提升技能使用的可靠性。
研究机构
The Tesseract Academy
论文信息