摘要
本文在重复博弈论场景中评估大语言模型(LLM),旨在判断其战略表现是源于真实的推理能力还是对记忆模式的依赖。研究选取囚徒困境和石头剪刀布两种经典博弈,引入改变收益结构和行动标签的反事实变体,以打破熟悉的对称性和优势关系。通过多指标评估框架对比默认与反事实实例,揭示了 LLM 在反事实环境中对激励敏感性、结构泛化能力及战略推理方面的局限性。
AI 推荐理由
论文核心评估 LLM 在反事实博弈中的战略推理能力,区分真实推理与记忆模式。
研究机构
国家技术大学雅典
论文信息