摘要
大语言模型在代码生成基准测试中表现优异,但这往往反映了记忆而非真实推理。本文提出 EsoLang-Bench,利用五种因经济非理性而极少出现在预训练数据中的深奥编程语言构建基准。评估显示,前沿模型在标准测试中得分高达 85-95%,但在同等难度的深奥语言任务中仅得 0-11%。少样本学习与自我反思均未能提升性能,表明现有技术依赖训练先验而非真实学习。该基准通过模拟人类基于文档和反馈的学习过程,首次实现了对抗数据污染的可迁移推理技能评估。
AI 推荐理由
论文核心旨在评估 LLM 的真实推理能力,通过冷门语言排除记忆干扰,直接针对推理机制进行研究。
研究机构
中国机构未明确标注
论文信息