LLM Safety Process Control Reasoning Reliability Architecture Design
摘要

大型语言模型虽具备强大生成能力,但在对抗性提示下易产生幻觉且推理不可靠。现有安全方法多作用于行为层面,缺乏保障推理过程完整性的显式架构机制。本文提出 Box Maze 框架,一种概念性过程控制架构,将 LLM 推理分解为记忆锚定、结构化推断和边界执行三个显式层。初步仿真评估显示,该架构在对抗场景下能将边界失效率从基线的 40% 降至 1% 以下,表明过程级控制是提升 LLM 推理可靠性的有效方向。

AI 推荐理由

提出 Box Maze 架构以增强 LLM 推理过程的完整性与可靠性,核心聚焦推理机制。

研究机构
中国
论文信息
作者 Zou Qiang
发布日期 2026-03-19
arXiv ID 2603.19182
相关性评分 9/10 (高度相关)