摘要
本文介绍了 SWE-QA,一个旨在基准测试多跳代码理解的文本与代码语料库,填补了简化评估任务与现实软件开发所需复杂推理之间的差距。现有基准多关注孤立代码片段,而开发者需连接分散的代码段信息。该数据集包含从 12 个 Python 仓库生成的 9072 道选择题,评估声明与调用、交互实体等推理模式。通过解析提取和 LLM 辅助构建,并经过严格验证,该基准能有效区分真实理解与表面模式匹配。对 15 种模型的评估显示多跳推理极具挑战性,最佳准确率仅为 74.41%。
AI 推荐理由
论文核心聚焦于评估 LLM 在代码理解中的多跳推理能力,直接针对推理机制进行基准测试。
研究机构
LRE, EPITA
论文信息