摘要
大型语言模型在编码任务中表现卓越,但其应用需建立在对程序执行的真正理解之上,而非依赖表面模式。现有基准多聚焦于特定输入下的属性预测,视角狭窄且易受数据污染。本文主张通过两项互补任务评估执行理解的内在二元性:一是预测给定输入的程序行为,二是推断为实现特定目标所需的输入变异。这两项任务共同探测模型对执行流的因果理解。基于此构建的 DexBench 基准包含 445 个配对实例,对 13 个模型的评估表明,双路径推理是动态代码理解的稳健且具有区分度的代理指标。
AI 推荐理由
论文核心提出程序执行推理的二元性框架,旨在评估模型对代码因果逻辑的深层理解能力。
研究机构
Department of Computer Science, University of Central Florida
论文信息