摘要
尽管大语言模型(LLM)功能强大,但其思维能力常受质疑,尤其在解决人类可系统处理的简单问题时表现不佳。现有研究多聚焦于复杂问题,忽视了简单逻辑推理的鲁棒性。本文提出“荒诞世界”基准测试框架,通过打破现实世界模型中的符号、动作及事件逻辑,构建逻辑自洽但违背常识的荒诞场景,以测试 LLM 剥离现实模式后的纯逻辑推理能力。实验证明该框架能有效评估模型在面对任务变体时的推理稳健性。
AI 推荐理由
论文提出基准测试框架,核心目标是探测和评估 LLM 在荒诞场景下的逻辑推理鲁棒性。
研究机构
The Nueva School, San Mateo, USA
University of Southern California
Arizona State University
Notre Dame College, Dhaka, Bangladesh
National University of Singapore
论文信息