摘要
针对大语言模型驱动的生成式 Agent 在需打破规则的特殊情境(如火灾疏散)中推理能力不足的问题,本文提出了 PAVE 认知架构。该架构包含感知、评估、裁决和模拟四个模块,通过结构化上下文提取、多维合法性评分及基于人设阈值的硬门控机制,指导 Agent 做出是否违规的决策。实验表明,PAVE 能在确保违规正当性、服从权威、限制范围及事后恢复四个方面表现优异,其决策比传统方法更具结构性和可解释性,且被人类评估为更合理。
AI 推荐理由
提出 PAVE 认知架构,核心解决 Agent 在复杂情境下的合法性判断与决策推理机制。
研究机构
The University of Texas at Austin
Meta Reality Labs
University of Calgary
论文信息