摘要
大语言模型常被赋予不完全信息下的战略决策任务(如谈判),但其失败模式尚不明确。本文通过实验揭示了两类根本性内部机制缺陷:一是“观察 - 信念”缺口,即模型内部隐含信念虽比口头报告更准确,但在多跳推理中易退化并偏离贝叶斯一致性;二是“信念 - 行动”缺口,即内部信念转化为行动的能力弱于显式提示。研究指出,分析内部过程可暴露系统性漏洞,警示在缺乏稳健防护前需谨慎部署。
AI 推荐理由
论文深入分析 LLM 在不完全信息博弈中的多跳推理缺陷及信念漂移,核心聚焦推理机制。
研究机构
EPFL
The University of Texas at Austin
论文信息