摘要
现有代码基准多关注测试通过率,缺乏对模型恢复程序语义能力的诊断。本文提出 TraceEval,首个经执行验证的多语言代码语义推理基准,旨在从源代码中恢复程序运行时调用结构。该基准通过机械执行验证消除标注噪声,包含万余个真实程序及可复现构建流程。实验评估了多个大模型在零样本下的表现,并证明利用训练集微调可显著提升模型性能,缩小与最强模型的差距。
AI 推荐理由
论文核心聚焦于代码语义推理,评估 LLM 恢复程序运行时结构的能力,属于推理能力的深度研究。
研究机构
Singapore Management University
Monash University
Nanjing University of Science and Technology
GovTech Singapore
论文信息