Code Reasoning Benchmark Execution Verification Call Graph
摘要

现有代码基准多关注测试通过率,缺乏对模型恢复程序语义能力的诊断。本文提出 TraceEval,首个经执行验证的多语言代码语义推理基准,旨在从源代码中恢复程序运行时调用结构。该基准通过机械执行验证消除标注噪声,包含万余个真实程序及可复现构建流程。实验评估了多个大模型在零样本下的表现,并证明利用训练集微调可显著提升模型性能,缩小与最强模型的差距。

AI 推荐理由

论文核心聚焦于代码语义推理,评估 LLM 恢复程序运行时结构的能力,属于推理能力的深度研究。

研究机构
Singapore Management University Monash University Nanjing University of Science and Technology GovTech Singapore
论文信息
作者 Yikun Li, Jinfeng Jiang, Ting Zhang, Chengran Yang, Chenxing Zhong et al.
发布日期 2026-05-10
arXiv ID 2605.11006
相关性评分 9/10 (高度相关)