摘要
近期研究表明,大语言模型代理难以修正自身推理轨迹中的错误,但在面对外部来源的相同主张时修正率显著更高。本文探究这种不对称性是否源于能力缺陷或角色标签伪影。实验在保持错误主张字节完全一致的前提下,仅改变其包装角色(如思考、用户、工具或系统记忆)。结果显示,将主张重标记为外部角色可显著提升显式修正率。研究证实该失效并非认知缺陷,而是聊天模板伪影,并提出无需训练的提示结构干预方法。
AI 推荐理由
论文核心研究 LLM 自我修正推理错误的机制,揭示其受角色标签而非认知能力影响。
研究机构
National Cheng Kung University
论文信息