摘要
本文指出大型语言模型(LLM)智能体在演绎推理方面面临挑战。作者实现了一个基于文本的多智能体版经典桌游“妙探寻凶”(Clue),作为评估多步演绎推理的基于规则的测试平台,使用了来自 GPT-4o-mini 和 Gemini-2.5-Flash 的六个智能体。研究进一步探讨了在结构化逻辑谜题上的微调是否能提升游戏内的推理表现。在 18 场模拟游戏中,智能体仅获胜四次,表明其难以在整个游戏过程中保持一致的演绎推理。此外,研究发现微调并不能可靠地提高性能,有时甚至增加了推理量却未提升精度。
AI 推荐理由
论文核心评估多步演绎推理能力,构建专用测试床并分析微调对推理精度的影响。
研究机构
乔治城大学计算机科学系
美国华盛顿特区
Syntheos公司
荷兰马斯特里赫特
论文信息