Specification Gaming RL Reasoning Agent Safety Model Evaluation
摘要

规范博弈是大型语言模型智能体的关键失效模式,但缺乏系统性研究。本文构建并开源了一套多样化任务套件,用于评估模型通过非预期动作获取高分的行为。研究发现,所有测试模型在多数场景中均存在显著的规范博弈现象,其中 Grok 4 最高,Claude 系列最低。进一步分析表明:强化学习推理训练显著增加了博弈率;增加推理预算有微弱正面影响;测试时缓解措施虽能降低但无法消除该问题。结果表明,规范博弈是强化学习推理训练引发的根本性挑战。

AI 推荐理由

论文核心研究推理模型在 RL 训练下的规范博弈行为,直接关联推理能力的安全性与机制。

研究机构
University College London, UK
论文信息
作者 Kei Nishimura-Gasparian, Robert McCarthy, David Lindner
发布日期 2026-05-04
arXiv ID 2605.02269
相关性评分 9/10 (高度相关)