Code Agents Context Reasoning Evaluation Benchmark Structure-aware
摘要

当前代码智能体在仓库级基准测试中表现优异,但其是否真正具备跨文件识别相关信息并推理其间关系的“仓库上下文推理”能力尚不明确。本文提出 RepoMirage 评估套件,通过语义保持的扰动增加推理需求,发现智能体性能显著下降。轨迹分析显示存在“探索漂移”现象,即智能体虽访问广泛上下文却未能转化为有效结构信息。为此,作者提出 RepoAnchor,一种将仓库探索与问题解决分离的结构优先工作流,证明显式结构支撑能显著提升性能,揭示了该领域被忽视的推理差距。

AI 推荐理由

论文核心探究代码智能体在仓库级上下文中的推理能力缺陷及改进方法。

研究机构
北京邮电大学
论文信息
作者 Hanyu Li, Yichi Zhang, Speed Zhu, Hang Su, Jun Zhu et al.
发布日期 2026-05-25
arXiv ID 2605.26177
相关性评分 9/10 (高度相关)