摘要
现有基准测试表明,即便结合思维链提示或概率信念更新,大型语言模型在心智理论任务上的表现仍显著低于人类水平。本文认为,这种失败主要源于不可靠的隐式状态跟踪,而非高层推理能力的局限。为此,我们提出了 PDDL-Mind,一种神经符号框架,将环境状态演化与信念推断解耦。该方法通过将叙事描述转化为规划领域定义语言(PDDL)表达的显式状态和动作,并针对预定义领域验证动作引发的状态转移,从而为心智理论任务提供逻辑一致且显式的世界状态表示。在 MMToM-QA、MuMA 和 FanToM 上的实验表明,PDDL-Mind 在心智理论基准问题上的准确率比现有最先进方法提高了超过 5%。
AI 推荐理由
论文核心解决心智理论中的信念推理问题,通过显式状态跟踪提升逻辑一致性。
研究机构
University of Southern California
论文信息