linguistic puzzles LLM evaluation human-AI comparison reasoning benchmarks
摘要

本文研究了高中语言学竞赛中使用的两种常见谜题格式:罗塞塔石(Rosetta Stone)和配对(Match-Up)。作者提出了一套系统程序,将现有的罗塞塔石谜题转换为对应的配对格式,以解决谜题创作复杂耗时的问题,从而加速新谜题的生成。研究通过人类参与者和大型语言模型(LLM)对生成的谜题对进行了评估。结果显示,专家人类解题者和 LLM 在配对谜题上均表现出“全有或全无”的模式,即要么完全解决,要么彻底失败。该工作贡献了一个新的配对谜题数据集,并详细评估了不同格式下的谜题难度,为理解人类与机器的语言推理提供了深刻见解。

AI 推荐理由

论文评估 LLM 在语言谜题中的推理表现,虽非提出新推理架构,但深入分析了机器与人类的推理模式差异。

研究机构
City University of New York (CUNY) Phillips Academy
论文信息
作者 Neh Majmudar, Anne Huang, Jinfan Frank Hu, Elena Filatova
发布日期 2026-05-13
arXiv ID 2605.13408
相关性评分 8/10 (高度相关)