Code Reasoning Benchmark Causal Understanding LLM Evaluation
摘要

大型语言模型在编码任务中表现卓越,但其应用需建立在对程序执行的真正理解之上,而非依赖表面模式。现有基准多聚焦于特定输入下的属性预测,视角狭窄且易受数据污染。本文主张通过两项互补任务评估执行理解的内在二元性:一是预测给定输入的程序行为,二是推断为实现特定目标所需的输入变异。这两项任务共同探测模型对执行流的因果理解。基于此构建的 DexBench 基准包含 445 个配对实例,对 13 个模型的评估表明,双路径推理是动态代码理解的稳健且具有区分度的代理指标。

AI 推荐理由

论文核心提出程序执行推理的二元性框架,旨在评估模型对代码因果逻辑的深层理解能力。

研究机构
Department of Computer Science, University of Central Florida
论文信息
作者 Eshgin Hasanov, Md Mahadi Hassan Sibat, Santu Karmaker, Aashish Yadavally
发布日期 2026-04-22
arXiv ID 2604.20917
相关性评分 9/10 (高度相关)