Prompt Engineering Code Generation Ablation Study Popperian Falsification
摘要

大型语言模型常被赋予模仿科学家推理的提示“技能”(如波普尔证伪主义)以提升代码质量,但现有评估多存在偏差。本研究通过预注册的双层消融实验,对比了完整技能、仅标签支架及安慰剂对照组。结果显示,在前沿模型上因天花板效应未检测到差异;在小模型上,结构化支架显著提升了正确率,但完整技能相比仅标签支架并无额外收益。结论表明,性能提升主要源于提示的结构框架而非具体的波普尔程序内容。

AI 推荐理由

论文核心研究提示“技能”对代码生成的影响,通过对照实验区分技能内容与结构支架的作用。

研究机构
PythaLab, Yıldız Technical University, Istanbul, Turkey
论文信息
作者 Mehmet Iscan
发布日期 2026-06-04
arXiv ID 2606.06454
相关性评分 9/10 (高度相关)