摘要
大型语言模型在开放式推理任务中常因“幻觉滚雪球”现象导致内在自我修正失败,即模型在自由文本反思中递归地合理化早期错误。本研究探讨仅通过基于 Outlines 的约束解码强制结构化反思,能否在不额外训练的情况下阻断错误传播。实验发现,单纯施加结构约束不仅未提升自我修正性能,反而引发了新的“结构滚雪球”失败模式。严格的格式规则增加了认知负荷,使模型陷入格式陷阱,虽实现表面句法对齐,却无法检测或解决深层语义错误。这揭示了约束解码固有的“对齐代价”。
AI 推荐理由
核心研究 LLM 自我反思中的错误传播机制及约束解码对自我修正能力的影响。
研究机构
埃拉斯姆斯大学语言与传播技术硕士项目(Erasmus Mundus Master's in Language and Communication Technologies)
萨尔兰大学(Saarland University)
德国萨尔布吕肯(Saarbrücken, Germany)
论文信息