摘要
大型语言模型虽具备强大生成能力,但在对抗性提示下易产生幻觉且推理不可靠。现有安全方法多作用于行为层面,缺乏保障推理过程完整性的显式架构机制。本文提出 Box Maze 框架,一种概念性过程控制架构,将 LLM 推理分解为记忆锚定、结构化推断和边界执行三个显式层。初步仿真评估显示,该架构在对抗场景下能将边界失效率从基线的 40% 降至 1% 以下,表明过程级控制是提升 LLM 推理可靠性的有效方向。
AI 推荐理由
提出 Box Maze 架构以增强 LLM 推理过程的完整性与可靠性,核心聚焦推理机制。
研究机构
中国
论文信息